Noeton 落地路线 02 / 05

把 KV 缓存从显卡里解放出来:CXL 池化与 Mooncake 的启示

2026 年 6 月 12 日

论文对 L1 内存中心基底的第二个要求是容量解耦:KV 缓存的天花板不应该是「单卡显存」,而应该是「池化容量」。这一条是五条原则里落地最快的——因为它已经在生产环境里发生了。

Mooncake:KV 缓存中心化的生产级证明

清华 MADSys 与月之暗面联合发表的 Mooncake 是 Kimi 的线上推理平台,架构思想与论文几乎同构:以 KV 缓存为中心组织整个集群,prefill 与 decode 分簇部署,把集群里闲置的 CPU 内存和 SSD 组成一个分布式 KV 缓存池。几个值得记住的事实:

  • Mooncake Store 已于 2025 年 3 月开源,2025 年 12 月其 Transfer Engine 被直接集成进 vLLM v1 作为 P/D 分离的 KV Connector,2026 年 2 月加入 PyTorch 生态;
  • 它支撑 Kimi K2 在 128 张 H200 上以 P/D 分离 + 大规模专家并行部署,达到 224k tokens/s prefill、288k tokens/s decode 的吞吐。

换句话说:论文里「KV 缓存按温度分层、跨机器伸缩」的图景(亲手玩:KV 分级实验),在软件层已经是国产系统的工业现实,而非愿景。

CXL:硬件解耦的标准通道

软件池化用的是 RDMA 网络;要把延迟再压一个量级,需要 CXL。进展同样实在:

  • 澜起科技(Montage)2025 年 8 月发布基于 CXL 3.1 Type 3 的内存扩展控制器 MXC M88MX6852(PCIe 6.2 ×8 @64GT/s,双通道 DDR5-8000,双 RISC-V 核),已向主要客户送样,三星、AMD、英特尔均公开站台。CXL 内存控制器这个生态位上,中国公司处在第一梯队
  • 三星 CMM 系列内存模组、各云厂商的 CXL 池化试点持续推进;SK 海力士路线图甚至把 PIM 与 CXL 的合体排进了 2028。

卡点:延迟阶梯上的「中间空档」

实事求是地讲,CXL 内存的访问延迟(数百纳秒级)仍显著高于本地 DDR,低于 RDMA(微秒级)。这恰好造出一个多级阶梯——而今天的推理框架只认识「显存/主机内存」两级,没有一个调度器原生理解完整的阶梯。

交互演示:取同一个 KV 块,四种代价

点「取一个 KV 块」,看同一次访问落在四个层级上的时间差——注意这是对数感受:SSD 与 HBM 之间差着约三个数量级。温度调度器的全部使命,就是让热数据永远落在左边的车道。

论文精读

内存解耦这条线的 6 篇必读文献——从 PagedAttention 到 Azure 的 CXL 池化实测:

FAST 2025 最佳论文 · 清华 & 月之暗面Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving

以 KV 缓存为中心重组推理集群:prefill/decode 分簇,闲置 CPU 内存与 SSD 组成分布式缓存池,「以存换算」在真实流量下使有效吞吐显著提升。架构论文拿下存储顶会最佳论文,本身就说明了风向。

→ 对 Noeton:L1 的「池化容量」不是赌注而是已验证的工程事实——直接站上去。
SOSP 2023 · UC BerkeleyEfficient Memory Management for LLM Serving with PagedAttention(vLLM)

把操作系统的分页思想搬进 KV 缓存管理:按块分配、消除碎片,吞吐提升 2-4 倍。vLLM 由此成为开源推理事实标准。

→ 对 Noeton:「OS 抽象迁移进模型栈」的范例——L1 的内存管理器应当原生按页/块思考,分层迁移才有最小单位。
ISCA 2024 · 微软研究院Splitwise: Efficient Generative LLM Inference Using Phase Splitting

用生产集群数据证明 prefill 与 decode 的资源画像截然不同,把两阶段拆到不同机器池(甚至不同代 GPU),同功耗下吞吐大幅提升。

→ 对 Noeton:论文 P4「split inference」的直接学术对应——分域不是损失,是利润。
OSDI 2024 · 北大 & UCSDDistServe: Disaggregating Prefill and Decoding for Goodput-optimized LLM Serving

P/D 分离的调度理论化:以 goodput(满足延迟约束的有效吞吐)为目标分别优化两阶段的并行度与放置,证明合并部署在双延迟约束下必然次优。

→ 对 Noeton:为「请求按阶段跨层级调度」给出了形式化的优化框架。
ASPLOS 2023 · 微软 AzurePond: CXL-Based Memory Pooling Systems for Cloud Platforms

Azure 真实集群数据驱动的 CXL 池化设计:约 50% 的虚拟机内存长期未被触碰,小规模池(8-16 主机)即可回收大部分搁浅内存,并给出延迟敏感性的机器学习预测器。

→ 对 Noeton:云厂商已为「内存当池用」给出经济学证明——KV 池只是它最锋利的特例。
ACM Computing Surveys · Intel/MicrosoftAn Introduction to the Compute Express Link (CXL) Interconnect

CXL 1.0→3.0 的权威技术综述:一致性协议、Type 1/2/3 设备模型、池化与共享语义、延迟构成的逐项拆解。

→ 对 Noeton:L1 与 CXL 生态对接的工程手册——尤其是 3.x 的多级交换与共享内存语义。

Noeton 的落地方案

  1. 直接采用 Mooncake/vLLM 生态做 L1 的「池化层」原型——不重复造轮子,把工程投入放在它们尚未覆盖的地方;
  2. 为多级延迟阶梯写一个温度调度器:热 KV 驻留显存、温 KV 进 CXL 池、冷 KV 落 RDMA/SSD,迁移决策由注意力命中统计驱动——这正是我们 KV 分级实验演示的策略,工程上是一个可独立交付的中间件;
  3. 基于澜起 RDK 做 CXL 池化测试床:国产控制器 + 国产整机,验证 KV 池在真实 CXL 硬件上的延迟收益,对照 Pond 的方法论形成可发表的对比数据。

一句话:内存解耦不需要赌未来——软件层抄 Mooncake 的现实,硬件层接澜起的样片,中间缺的那个温度调度器,就是我们的位置。


行业动态参考:Mooncake(GitHub) · vLLM × Mooncake 博客 · 澜起 CXL 3.1 MXC