把 KV 缓存从显卡里解放出来:CXL 池化与 Mooncake 的启示
论文对 L1 内存中心基底的第二个要求是容量解耦:KV 缓存的天花板不应该是「单卡显存」,而应该是「池化容量」。这一条是五条原则里落地最快的——因为它已经在生产环境里发生了。
Mooncake:KV 缓存中心化的生产级证明
清华 MADSys 与月之暗面联合发表的 Mooncake 是 Kimi 的线上推理平台,架构思想与论文几乎同构:以 KV 缓存为中心组织整个集群,prefill 与 decode 分簇部署,把集群里闲置的 CPU 内存和 SSD 组成一个分布式 KV 缓存池。几个值得记住的事实:
- Mooncake Store 已于 2025 年 3 月开源,2025 年 12 月其 Transfer Engine 被直接集成进 vLLM v1 作为 P/D 分离的 KV Connector,2026 年 2 月加入 PyTorch 生态;
- 它支撑 Kimi K2 在 128 张 H200 上以 P/D 分离 + 大规模专家并行部署,达到 224k tokens/s prefill、288k tokens/s decode 的吞吐。
换句话说:论文里「KV 缓存按温度分层、跨机器伸缩」的图景(亲手玩:KV 分级实验),在软件层已经是国产系统的工业现实,而非愿景。
CXL:硬件解耦的标准通道
软件池化用的是 RDMA 网络;要把延迟再压一个量级,需要 CXL。进展同样实在:
- 澜起科技(Montage)2025 年 8 月发布基于 CXL 3.1 Type 3 的内存扩展控制器 MXC M88MX6852(PCIe 6.2 ×8 @64GT/s,双通道 DDR5-8000,双 RISC-V 核),已向主要客户送样,三星、AMD、英特尔均公开站台。CXL 内存控制器这个生态位上,中国公司处在第一梯队;
- 三星 CMM 系列内存模组、各云厂商的 CXL 池化试点持续推进;SK 海力士路线图甚至把 PIM 与 CXL 的合体排进了 2028。
卡点:延迟阶梯上的「中间空档」
实事求是地讲,CXL 内存的访问延迟(数百纳秒级)仍显著高于本地 DDR,低于 RDMA(微秒级)。这恰好造出一个多级阶梯——而今天的推理框架只认识「显存/主机内存」两级,没有一个调度器原生理解完整的阶梯。
交互演示:取同一个 KV 块,四种代价
点「取一个 KV 块」,看同一次访问落在四个层级上的时间差——注意这是对数感受:SSD 与 HBM 之间差着约三个数量级。温度调度器的全部使命,就是让热数据永远落在左边的车道。
论文精读
内存解耦这条线的 6 篇必读文献——从 PagedAttention 到 Azure 的 CXL 池化实测:
以 KV 缓存为中心重组推理集群:prefill/decode 分簇,闲置 CPU 内存与 SSD 组成分布式缓存池,「以存换算」在真实流量下使有效吞吐显著提升。架构论文拿下存储顶会最佳论文,本身就说明了风向。
→ 对 Noeton:L1 的「池化容量」不是赌注而是已验证的工程事实——直接站上去。 SOSP 2023 · UC BerkeleyEfficient Memory Management for LLM Serving with PagedAttention(vLLM)把操作系统的分页思想搬进 KV 缓存管理:按块分配、消除碎片,吞吐提升 2-4 倍。vLLM 由此成为开源推理事实标准。
→ 对 Noeton:「OS 抽象迁移进模型栈」的范例——L1 的内存管理器应当原生按页/块思考,分层迁移才有最小单位。 ISCA 2024 · 微软研究院Splitwise: Efficient Generative LLM Inference Using Phase Splitting用生产集群数据证明 prefill 与 decode 的资源画像截然不同,把两阶段拆到不同机器池(甚至不同代 GPU),同功耗下吞吐大幅提升。
→ 对 Noeton:论文 P4「split inference」的直接学术对应——分域不是损失,是利润。 OSDI 2024 · 北大 & UCSDDistServe: Disaggregating Prefill and Decoding for Goodput-optimized LLM ServingP/D 分离的调度理论化:以 goodput(满足延迟约束的有效吞吐)为目标分别优化两阶段的并行度与放置,证明合并部署在双延迟约束下必然次优。
→ 对 Noeton:为「请求按阶段跨层级调度」给出了形式化的优化框架。 ASPLOS 2023 · 微软 AzurePond: CXL-Based Memory Pooling Systems for Cloud PlatformsAzure 真实集群数据驱动的 CXL 池化设计:约 50% 的虚拟机内存长期未被触碰,小规模池(8-16 主机)即可回收大部分搁浅内存,并给出延迟敏感性的机器学习预测器。
→ 对 Noeton:云厂商已为「内存当池用」给出经济学证明——KV 池只是它最锋利的特例。 ACM Computing Surveys · Intel/MicrosoftAn Introduction to the Compute Express Link (CXL) InterconnectCXL 1.0→3.0 的权威技术综述:一致性协议、Type 1/2/3 设备模型、池化与共享语义、延迟构成的逐项拆解。
→ 对 Noeton:L1 与 CXL 生态对接的工程手册——尤其是 3.x 的多级交换与共享内存语义。Noeton 的落地方案
- 直接采用 Mooncake/vLLM 生态做 L1 的「池化层」原型——不重复造轮子,把工程投入放在它们尚未覆盖的地方;
- 为多级延迟阶梯写一个温度调度器:热 KV 驻留显存、温 KV 进 CXL 池、冷 KV 落 RDMA/SSD,迁移决策由注意力命中统计驱动——这正是我们 KV 分级实验演示的策略,工程上是一个可独立交付的中间件;
- 基于澜起 RDK 做 CXL 池化测试床:国产控制器 + 国产整机,验证 KV 池在真实 CXL 硬件上的延迟收益,对照 Pond 的方法论形成可发表的对比数据。
一句话:内存解耦不需要赌未来——软件层抄 Mooncake 的现实,硬件层接澜起的样片,中间缺的那个温度调度器,就是我们的位置。
行业动态参考:Mooncake(GitHub) · vLLM × Mooncake 博客 · 澜起 CXL 3.1 MXC