推理系统 · 实验 02 / 04

记忆,按温度分层。

TIERED KV CACHE · HOT ⇅ COLD

上下文越长,越没有理由让每个 token 都住在最贵的内存里。

KV 缓存是自回归推理的「会话记忆」:每个 token 的键值对都要留下来供后续注意力查询。上下文涨到几十万 token 时,KV 缓存比模型权重还大——而其中大部分 token 在大部分时刻根本不会被注意力命中。

答案和操作系统的页面置换一脉相承:按访问温度分层。刚生成的、频繁命中的 KV 块驻留在存内计算阵列里(零搬运成本参与注意力计算);长期未命中的块按温度下沉到 CXL 池化内存;一旦旧话题被重新提起,对应的块再被预取回热层。

LIVE LAB
上下文窗口注意力直读 · 0
PIM 热层~0.8 ms 命中 · 0
池化内存冷层~12 ms 召回 · 0

对话持续进行:新 KV 块进入上下文,老化后沉入热层、再坠入冷层。点击「引用 3 分钟前的内容」——看那个被遗忘的块发光、被预取回热层。(演示数值)

01

温度即层级

命中频率决定居住地:热块零距离参与计算,温块毫秒级可达,冷块按需召回——成本差两个数量级。

02

下沉是常态

注意力天然稀疏:长上下文里 90% 以上的 KV 块长期无人问津,留在热层纯属浪费。

03

预取靠语义

Model-OS 知道话题在往哪走——旧话题重现的征兆出现时,相关 KV 块已在回热层的路上。