推理系统 · 实验 04 / 04

用一条线,看穿一台机器

INTERACTIVE ROOFLINE · perf = min(BW·I, PEAK)

所有架构争论,最后都要回到这张图上对质。

Roofline 模型只有一条规则:可达性能 = min(带宽 × 算术强度, 峰值算力)。屋顶的斜坡段属于带宽受限的负载,平顶段属于算力受限的负载,两段交汇处叫脊点。一个负载站在哪一段,决定了什么样的硬件升级对它有效。

LLM 解码的算术强度趋近常数(每字节一两次运算),永远站在斜坡段最左端——这就是为什么堆算力对解码无效:NPU 抬高的是它永远摸不到的平顶。下面这张图是活的,请亲手验证。

LIVE LAB
带宽受限区 算力受限区 算术强度 I(FLOP / byte,log) 可达性能(log) 脊点 LLM 解码 预填充
LLM 解码可达性能 10 基线 ×1.0
预填充可达性能 100 基线 ×1.0
把两根滑杆都拉到 ×10 试试。

解码(蓝点)站在斜坡上:带宽拉几倍,它就涨几倍;算力拉到 ×10,它纹丝不动——那条平顶它根本摸不到。这就是「AI PC 困境」的全部数学。(相对值演示)

01

位置决定药方

斜坡段的病要用带宽治,平顶段的病要用算力治——开错药方的升级只产生发布会效果。

02

解码钉死在左端

自回归生成每字节运算次数是常数,模型再大也改变不了它在 roofline 上的横坐标。

03

PIM 改变规则

存内计算不是把点往右移,而是把整条斜坡抬起来——这正是 Noeton内存中心组织的依据。