模型原生架构 · MNA
大模型推理的代价不在算术,在搬运。 所以我们不再把数据搬向计算——让计算住进数据里。
典型 LLM 解码负载中,
能耗花在数据搬运而非计算†
存内计算与池化内存
打开的有效带宽空间†
条原则,
定义模型原生架构
† 基于公开研究的量级估计,详见我们的论文论证。
内存墙 · THE MEMORY WALL
处理器算力一路狂奔,内存带宽缓步爬行——差距按指数累积。 大模型推理,正好一头撞在这道墙上。
增长率取经典体系结构文献的量级(Hennessy & Patterson;Wulf & McKee, 1995),示意图。
能耗账本 · ENERGY LEDGER
一次 64 位浮点乘法约 4 pJ;把同样 64 位数据从片外 DRAM 搬进来——640 pJ。 计算早就不是瓶颈,搬运才是。
每个亮点 = 一次乘法的能量(4 pJ)。数据:M. Horowitz, ISSCC 2014(45nm 量级);跨节点为典型量级示意。
大模型系统
预填充吃算力,解码吃带宽——它们本不该挤在同一块芯片上。
同一次请求:计算密集的 Prefill 与带宽密集的 Decode 流向不同的硬件域
智能体
当 LLM 成为内核,操作系统的一切都值得重写一遍。
调度、记忆与上下文管理——让一群智能体像进程一样被创建、挂起与协作。
工具即系统调用:权限、沙箱与审计内建于运行时,而不是事后补丁。
用户表达「对上下文的意图」,机器解析为行为——指令式交互的终点。
亲手试试 · L5
不是命令行,也不是按钮——点一句意图,看 Model-OS 把它编译成计划并执行。(站内模拟)
点击上方任意一句意图开始 ▍
路线 · FROM HERE TO NOETON
不是科幻——每一步都踩在已经发生的产业事实上。
Model-OS 作为运行时跑在现有硬件上:Agent 调度、向量记忆、工具网关。业界同行者:MemGPT、AIOS、各家 Agent 框架。
HBM-PIM × CXL 池化的推理服务器,prefill/decode 分域调度。产业基石已现:三星 HBM-PIM、SK 海力士 AiM、CXL 3.x 生态。
张量数据流织物 + 意图接口的整机形态。当解码成本再降一个量级,交互范式自然翻页。
证据 · 论文 v2 新增章节
Rubin CPX 只为 prefill 而生、CloudMatrix 384 让内存绕过 CPU 直连、MCP 一年完成标准化—— 我们把 2024 年以来的产业事件逐条归档到五条原则下。