QUANTA · 全他科技

为模型而生
的计算。

七十年来,计算机围绕 CPU 组织。
我们认为,下一代计算机围绕模型组织。

$ boot 

模型原生架构 · MNA

计算,回到内存的中心

大模型推理的代价不在算术,在搬运。
所以我们不再把数据搬向计算——让计算住进数据里。

70%

典型 LLM 解码负载中,
能耗花在数据搬运而非计算

10×

存内计算与池化内存
打开的有效带宽空间

5

条原则,
定义模型原生架构

† 基于公开研究的量级估计,详见我们的论文论证。

内存墙 · THE MEMORY WALL

四十五年,剪刀差越张越大。

处理器算力一路狂奔,内存带宽缓步爬行——差距按指数累积。
大模型推理,正好一头撞在这道墙上。

处理器算力 ~52%/年 内存带宽 ~25%/年
到 2025 年,累积差距 ——这就是「内存墙」

增长率取经典体系结构文献的量级(Hennessy & Patterson;Wulf & McKee, 1995),示意图。

能耗账本 · ENERGY LEDGER

搬运一次,够算上百次

一次 64 位浮点乘法约 4 pJ;把同样 64 位数据从片外 DRAM 搬进来——640 pJ。 计算早就不是瓶颈,搬运才是

算一次(64 位浮点乘)
4 pJ
= 160 次乘法的能量
搬一次(64 位 · DRAM)
640 pJ

每个亮点 = 一次乘法的能量(4 pJ)。数据:M. Horowitz, ISSCC 2014(45nm 量级);跨节点为典型量级示意。

Noeton · 五层爆炸图

滚动,拆开 Noeton。

↓ 滚动展开五层 · 点击图例进入每层详解,或看 五层栈总览 →

大模型系统

推理,被重新调度

预填充吃算力,解码吃带宽——它们本不该挤在同一块芯片上。

意图 intent Model-OS 意图解析 · 调度 算力域 Prefill · compute-bound 带宽域 Decode · bandwidth-bound token 流

同一次请求:计算密集的 Prefill 与带宽密集的 Decode 流向不同的硬件域

进入推理系统专题:四个可视化实验 →

智能体

Agent,是新的进程

当 LLM 成为内核,操作系统的一切都值得重写一遍。

进入 Model-OS 专题:操作系统的下一次相变 →

Agent 运行时

调度、记忆与上下文管理——让一群智能体像进程一样被创建、挂起与协作。

工具编排

工具即系统调用:权限、沙箱与审计内建于运行时,而不是事后补丁。

意图驱动交互

用户表达「对上下文的意图」,机器解析为行为——指令式交互的终点。

亲手试试 · L5

给 Noeton 下一道意图

不是命令行,也不是按钮——点一句意图,看 Model-OS 把它编译成计划并执行。(站内模拟)

model-os — intent shell
点击上方任意一句意图开始 ▍

路线 · FROM HERE TO NOETON

通往 Noeton 的三步

不是科幻——每一步都踩在已经发生的产业事实上。

现在

软件先行

Model-OS 作为运行时跑在现有硬件上:Agent 调度、向量记忆、工具网关。业界同行者:MemGPT、AIOS、各家 Agent 框架。

近期

内存中心机柜

HBM-PIM × CXL 池化的推理服务器,prefill/decode 分域调度。产业基石已现:三星 HBM-PIM、SK 海力士 AiM、CXL 3.x 生态。

远期

完整 Noeton

张量数据流织物 + 意图接口的整机形态。当解码成本再降一个量级,交互范式自然翻页。

证据 · 论文 v2 新增章节

世界正在走向 Noeton

Rubin CPX 只为 prefill 而生、CloudMatrix 384 让内存绕过 CPU 直连、MCP 一年完成标准化——
我们把 2024 年以来的产业事件逐条归档到五条原则下。

研究

我们公开发表判断。