QUANTA 研究 · 立场 / 愿景论文 · v2(2026 年 6 月修订 · 新增「产业轨迹」章节)

超越计算机:
The Noeton

一种面向 AI 时代的模型原生架构(Model-Native Architecture, MNA)—— Noeton,从硬件层面、围绕大语言模型重新设计。

von Neumann machine  →  Noeton

为什么

七十年的契约,正被逼到崩溃边缘

七十年来,计算机一直是一台冯·诺依曼机:中央处理器经由总线,从被动存储中逐条取出指令与数据。 而基础模型推理的主导代价不在算术,而在搬运——庞大且基本静态的权重张量、不断增长的 KV 缓存。自回归解码受内存带宽支配,而非浮点吞吐。业界当下的答案 「AI PC」——一台外挂 NPU 的冯·诺依曼机——只是过渡形态,而非终极形态。

论文摘要(节选)
我们主张从硬件层面、围绕模型重新设计计算本身,并将其结果命名为Noeton (源自希腊语 noesis,「理解、理智之行为」)。Noeton 立于五条原则之上, 以既有的硬件与系统研究——内存墙、存内计算、CXL 内存池化、晶圆级集成、确定性数据流处理器、 神经形态芯片,以及新兴的「LLM 操作系统」——逐一支撑,并综合为一套连贯的参考设计。 我们并不构建 Noeton;这是一篇立场论文。我们把它作为一个值得争论的目标提出,并认真对待其代价。
Roofline 分析:LLM 解码受内存带宽限制
解码贴在带宽天花板上——更快的 NPU 抬高的是用不到的算力天花板
核心主张

五条原则,定义模型原生架构

每条原则都有既有研究背书:HBM-PIM、UPMEM、CXL 池化、TPU/Groq/SambaNova 数据流、MemGPT/AIOS……

P1

内存中心组织

权重与 KV 缓存是一等公民:由存内计算(PIM)与解耦池化内存就地服务,而不是经由一个核心被反复搬运。

P2

模型原生计算

一张张量 / 注意力数据流织物承担主计算;传统 CPU 被降格为「管家式」协调者,只做控制与杂务。

P3

模型即操作系统

LLM 作为内核:智能体是进程,工具是系统调用,向量库是文件系统——Model-OS 取代传统 OS 的地位。

P4

强制联网 · 分层认知

端侧小模型只提供降级模式的基础功能,完整能力来自「设备 → 边缘 → 云」的网络化权重池。

P5

意图驱动交互

用户的工作单元是「针对上下文表达的意图」,而非「针对数据下达的指令」。

架构总览

从对比图到五层栈

全部图示为论文原版矢量图(TikZ 直出 SVG),点开论文可见完整论证。

图 1 · 冯·诺依曼机 vs Noeton:从「计算居中」到「内存驻留模型居中」
图 1 · 冯·诺依曼机 vs Noeton:从「计算居中」到「内存驻留模型居中」
图 2 · Noeton 五层栈:L1 内存中心基底 → L5 意图接口
图 2 · Noeton 五层栈:L1 内存中心基底 → L5 意图接口
图 3 · Roofline 论证:LLM 解码受内存带宽支配,更快的 NPU 只抬高用不到的算力天花板
图 3 · Roofline 论证:LLM 解码受内存带宽支配,更快的 NPU 只抬高用不到的算力天花板
图 4 · 分层认知:设备 / 边缘 / 云三级,请求在能满足它的最便宜层级被解决
图 4 · 分层认知:设备 / 边缘 / 云三级,请求在能满足它的最便宜层级被解决
论文下载

中英双语,全文开放

PDF

超越计算机:Noeton —— 一种面向 AI 时代的模型原生架构

中文完整版 v2 · 24 页 · 新增第 12 章「产业轨迹(2024–2026)」 · 配套:证据墙
下载中文版
PDF

Beyond the Computer: The Noeton — A Model-Native Architecture for the AI Era

English edition · ~22 pages · arXiv submission (cs.AR, cross-list cs.AI)
Download English PDF
计算机体系结构大语言模型内存墙存内计算内存解耦领域专用架构LLM 操作系统端云推理
博客

研究笔记与产品动态

关于 Noeton、模型原生架构与 AI 基础设施的更多讨论,会陆续发在博客

进入博客 →