Noeton 落地路线 03 / 05

确定性数据流:Groq 们证明了什么,还差什么

2026 年 6 月 12 日

L2 张量数据流织物的主张是:Transformer 推理几乎没有控制流,应该交给确定性数据流硬件,让 CPU 退役为管家。这条原则的妙处在于——它不需要我们自己证明,市场已经替我们证明了一半。

国外:三条已经跑通的路线

Groq LPU 是最纯粹的示范:完全确定性的同步数据流架构,编译期排定每一拍的数据移动,没有缓存、没有仲裁。结果是用 14nm 的老工艺打出了 500 tokens/s 级的解码吞吐和 10ms 以内的首 token 延迟,尾延迟稳得像一条直线——这正是论文「确定性执行让实时性从尽力而为变成合同条款」的商业版本。

SambaNova SN40L(可重构数据流,RDU)与 Cerebras WSE-3(晶圆级,片上 SRAM 直接装下模型的可观部分)从两个不同的角度逼近同一结论:把数据通路按张量运算图来组织,性能/能效就能甩开通用 GPU。Tesla Dojo 同样押注数据流。

值得注意的是它们共同的代价:每一家都被迫自建编译器栈。Groq 的优势恰恰不是芯片,而是它把「静态可知的运算图」吃干榨净的编译器。

国内:可重构这条线有真实积累

国内最对口的是清微智能——技术源自清华可重构计算团队(CGRA 路线积累近二十年),其高算力 TX8 系列已规模化量产。这意味着国产确定性/可重构数据流不是 PPT,是有出货的。另一边,华为昇腾(达芬奇架构的 3D Cube)、寒武纪等 NPU 虽不是严格意义的数据流机,但同样反映「为张量运算定制数据通路」的共识。

差距也要直说:国内数据流芯片在大模型场景的软件生态上与 Groq 差距大于硬件差距——FP8/混合精度支持、attention 变体(MLA、GQA、滑窗)的快速跟进、与 vLLM/SGLang 的对接成熟度,都是肉眼可见的短板。

卡点:编译器是 L2 的全部难度

数据流硬件的本质交换是:用编译期的全局规划换运行期的确定性。这要求编译器对模型图、量化方案、批调度有完全掌控。模型架构每变一次(MoE、MLA、线性注意力),编译器就要跟一次——谁的编译器迭代快,谁的硬件才有生命。

交互演示:尾延迟是怎么长出来的

让两台机器各自连续吐 token:左边模拟 GPU 共享调度(批间干扰带来随机卡顿),右边是编译期排定节拍的数据流。别只看平均值,看下面逐渐长出来的间隔分布直方图——p99 的差距就是「合同条款」与「尽力而为」的差距。

论文精读

数据流路线的 6 篇关键文献——从 Plasticine 的学术原型到 Groq 的商业闭环:

ISCA 2020 · GroqThink Fast: A Tensor Streaming Processor (TSP)

提出完全确定性的「张量流处理器」:取消缓存与动态调度,功能单元按编译器排定的流水节拍工作,芯片行为可在编译期逐周期预测。Groq LPU 的架构源头。

→ 对 Noeton:L2「确定性互连 + 编译期节拍」的原型证明——延迟可以是设计值而非统计值。
ISCA 2022 · GroqA Software-defined Tensor Streaming Multiprocessor

把确定性从单芯片扩展到多机:网络中没有交换仲裁,跨芯片通信同样由编译器静态排程,集群成为一台「同步大机器」。

→ 对 Noeton:织物的确定性可以跨越芯片边界——L2 与 L4 网络层的衔接有先例可循。
ISCA 2017 · StanfordPlasticine: A Reconfigurable Architecture for Parallel Patterns

可重构数据流的学术经典:以并行模式(map/reduce 等)为一等抽象组织计算与存储单元阵列,比 FPGA 高一个数量级的能效。SambaNova RDU 的学术前身。

→ 对 Noeton:「以并行模式为 ISA」启发了 L2 的算子级 IR 设计——抽象层选对,硬件可以换代。
ACM CSUR 2019 · 清华A Survey of Coarse-Grained Reconfigurable Architecture and Design

清华可重构计算团队的 CGRA 权威综述:从架构分类、编译技术到二十年的设计空间得失。清微智能正是这一脉的产业化。

→ 对 Noeton:国产可重构路线的理论家底——与 TX8 共建试点时的共同语言。
CACM 2020 · NVIDIA/StanfordDomain-Specific Hardware Accelerators(Dally 等)

领域专用加速器的设计法则:专用化的收益主要来自数据通路与内存层级的匹配,而非算术单元本身;通用性每让一步,能效进一档。

→ 对 Noeton:为「CPU 退役为管家」提供第一性原理——通用核心留在数据通路里只剩税收。
IEEE Micro 2023 · CerebrasCerebras Architecture Deep Dive: First Look Inside the HW/SW Co-Design

晶圆级引擎的软硬协同设计公开课:85 万核+片上 SRAM 的权重流式执行、跨「裂片」的容错布线、编译器如何把模型铺满一整张晶圆。

→ 对 Noeton:L1「晶圆级驻留」与 L2 织物在产品中合体的最接近样本。

Noeton 的落地方案

  1. 不从造芯开始,从「织物抽象」开始:定义 L2 的算子级 IR(中间表示),先在 GPU 上实现一个「伪数据流」运行时——静态调度、固定节拍、禁用动态分支,量化确定性收益;
  2. 与国产可重构平台共建试点:把第一步的 IR 对接到清微 TX8 这类已量产的可重构硬件上,跑通一个真实模型的解码路径,拿到「国产数据流 × 大模型」的第一手数据;
  3. prefill 不强求数据流:按 Split Inference 的分域逻辑,算力域继续用成熟 GPU,数据流织物专注解码——避免在自己最弱的战场决战。

一句话:L2 的正确姿势是「编译器先行,硬件借船出海」——Groq 证明了确定性值钱,清微证明了国产可重构能量产,中间的桥是一个对大模型友好的数据流编译栈。


行业动态参考:Groq LPU 报道(21 财经) · 清微智能可重构芯片