推理系统 · 实验 03 / 04
请求,落在最便宜的层级。
TIERED COGNITION · DEVICE → EDGE → CLOUD
端侧守住底线,边缘吃掉延迟,云端供给全量智能。
不是所有请求都值得惊动千亿参数。设个闹钟用端侧小模型绰绰有余;总结一篇网页交给边缘的中型模型刚刚好;起草一份跨境合同才需要云端的完整权重池。分层认知的调度原则只有一句话:请求总是在能满足它的最便宜层级被解决。
这也意味着 Noeton 被刻意设计为强制联网:端侧只保证降级模式的基础功能,完整能力来自网络化的权重池。断网的 Noeton「故意做不了多少事」——这是用自主性换能力密度的明确取舍,论文专门用一节讨论它的代价。
LIVE LAB
命中层级—
往返延迟—
能量成本—
点一个请求,看它落到哪一层。然后拉下网络开关再试一遍——边与云熄灭,复杂请求被打回,只有端侧底线还活着:这就是「降级模式」。(演示数值)
01
便宜优先
调度目标不是最快或最强,而是「刚好够」:满足质量约束的前提下,选延迟与能耗最低的层级。
02
能力即网络
权重池在网络里而非机器里——换更强的模型不用换机器,就像换自来水厂不用换水龙头。
03
降级有底线
离线时端侧保证听写、本地检索、基础控制可用——故意有限,但绝不为零。代价在论文中如实讨论。