NOETON 五层栈 · L1 / L5

L1 内存中心基底

MEMORY-CENTRIC SUBSTRATE

权重不再被搬运——它们住在计算里。

冯·诺依曼机把内存当成被动仓库:每一次计算都要把数据搬到 CPU 跟前。对大模型而言这是灾难——权重张量庞大而几乎静态,KV 缓存持续膨胀,搬运它们的能耗远超过计算本身。L1 的回答是颠倒主从:让权重与 KV 缓存成为机器的常驻中心,计算单元嵌进内存阵列里就地工作。

三种已被验证的技术构成这层基底:存内计算(HBM-PIM、UPMEM)把算术单元造进内存银行;CXL 池化让内存容量与单机解耦,KV 缓存可以横跨机箱伸缩;晶圆级集成(Cerebras WSE)证明了把整个模型放进一块硅片的可行性。Noeton 把三者综合成一个统一的「权重常驻」基底。

HBM-PIM 阵列

算术单元嵌入内存银行,注意力计算零距离展开

CXL 池化内存

容量与单机解耦,KV 缓存跨机箱弹性伸缩

晶圆级驻留

整模型驻留单片硅,消灭片外搬运

近存调度器

按访问温度在层间迁移 KV 块

交互演示 · LIVE

为什么权重必须住进内存?看这场能量赛跑——左边每做一次运算都要把数据拖过总线,右边在 bank 原位完成。

01

权重常驻

模型加载一次、长期驻留——「启动」从分钟级变成会话级概念。

02

带宽即性能

解码吞吐直接正比于基底带宽,roofline 实验可亲手验证。

03

容量解耦

上下文长度的天花板从「单卡显存」变成「池化容量」。

相关实验:KV 缓存分级 →