NOETON 五层栈 · L1 / L5
L1 内存中心基底
MEMORY-CENTRIC SUBSTRATE
权重不再被搬运——它们住在计算里。
冯·诺依曼机把内存当成被动仓库:每一次计算都要把数据搬到 CPU 跟前。对大模型而言这是灾难——权重张量庞大而几乎静态,KV 缓存持续膨胀,搬运它们的能耗远超过计算本身。L1 的回答是颠倒主从:让权重与 KV 缓存成为机器的常驻中心,计算单元嵌进内存阵列里就地工作。
三种已被验证的技术构成这层基底:存内计算(HBM-PIM、UPMEM)把算术单元造进内存银行;CXL 池化让内存容量与单机解耦,KV 缓存可以横跨机箱伸缩;晶圆级集成(Cerebras WSE)证明了把整个模型放进一块硅片的可行性。Noeton 把三者综合成一个统一的「权重常驻」基底。
HBM-PIM 阵列
算术单元嵌入内存银行,注意力计算零距离展开
CXL 池化内存
容量与单机解耦,KV 缓存跨机箱弹性伸缩
晶圆级驻留
整模型驻留单片硅,消灭片外搬运
近存调度器
按访问温度在层间迁移 KV 块
交互演示 · LIVE
为什么权重必须住进内存?看这场能量赛跑——左边每做一次运算都要把数据拖过总线,右边在 bank 原位完成。
01
权重常驻
模型加载一次、长期驻留——「启动」从分钟级变成会话级概念。
02
带宽即性能
解码吞吐直接正比于基底带宽,roofline 实验可亲手验证。
03
容量解耦
上下文长度的天花板从「单卡显存」变成「池化容量」。