一种面向 AI 时代的模型原生架构(Model-Native Architecture, MNA)—— Noeton,从硬件层面、围绕大语言模型重新设计。
von Neumann machine → Noeton
七十年来,计算机一直是一台冯·诺依曼机:中央处理器经由总线,从被动存储中逐条取出指令与数据。 而基础模型推理的主导代价不在算术,而在搬运——庞大且基本静态的权重张量、不断增长的 KV 缓存。自回归解码受内存带宽支配,而非浮点吞吐。业界当下的答案 「AI PC」——一台外挂 NPU 的冯·诺依曼机——只是过渡形态,而非终极形态。
每条原则都有既有研究背书:HBM-PIM、UPMEM、CXL 池化、TPU/Groq/SambaNova 数据流、MemGPT/AIOS……
权重与 KV 缓存是一等公民:由存内计算(PIM)与解耦池化内存就地服务,而不是经由一个核心被反复搬运。
一张张量 / 注意力数据流织物承担主计算;传统 CPU 被降格为「管家式」协调者,只做控制与杂务。
LLM 作为内核:智能体是进程,工具是系统调用,向量库是文件系统——Model-OS 取代传统 OS 的地位。
端侧小模型只提供降级模式的基础功能,完整能力来自「设备 → 边缘 → 云」的网络化权重池。
用户的工作单元是「针对上下文表达的意图」,而非「针对数据下达的指令」。
全部图示为论文原版矢量图(TikZ 直出 SVG),点开论文可见完整论证。