推理系统 · 实验 02 / 04
记忆,按温度分层。
TIERED KV CACHE · HOT ⇅ COLD
上下文越长,越没有理由让每个 token 都住在最贵的内存里。
KV 缓存是自回归推理的「会话记忆」:每个 token 的键值对都要留下来供后续注意力查询。上下文涨到几十万 token 时,KV 缓存比模型权重还大——而其中大部分 token 在大部分时刻根本不会被注意力命中。
答案和操作系统的页面置换一脉相承:按访问温度分层。刚生成的、频繁命中的 KV 块驻留在存内计算阵列里(零搬运成本参与注意力计算);长期未命中的块按温度下沉到 CXL 池化内存;一旦旧话题被重新提起,对应的块再被预取回热层。
LIVE LAB
上下文窗口
PIM 热层
池化内存冷层
对话持续进行:新 KV 块进入上下文,老化后沉入热层、再坠入冷层。点击「引用 3 分钟前的内容」——看那个被遗忘的块发光、被预取回热层。(演示数值)
01
温度即层级
命中频率决定居住地:热块零距离参与计算,温块毫秒级可达,冷块按需召回——成本差两个数量级。
02
下沉是常态
注意力天然稀疏:长上下文里 90% 以上的 KV 块长期无人问津,留在热层纯属浪费。
03
预取靠语义
Model-OS 知道话题在往哪走——旧话题重现的征兆出现时,相关 KV 块已在回热层的路上。