推理系统 · 实验 03 / 04

请求,落在最便宜的层级。

TIERED COGNITION · DEVICE → EDGE → CLOUD

端侧守住底线,边缘吃掉延迟,云端供给全量智能。

不是所有请求都值得惊动千亿参数。设个闹钟用端侧小模型绰绰有余;总结一篇网页交给边缘的中型模型刚刚好;起草一份跨境合同才需要云端的完整权重池。分层认知的调度原则只有一句话:请求总是在能满足它的最便宜层级被解决。

这也意味着 Noeton 被刻意设计为强制联网:端侧只保证降级模式的基础功能,完整能力来自网络化的权重池。断网的 Noeton「故意做不了多少事」——这是用自主性换能力密度的明确取舍,论文专门用一节讨论它的代价。

LIVE LAB
📱 端 · Device 小模型 · 能力底线 📡 边 · Edge 中模型 · 区域权重池 ☁️ 云 · Cloud 最大模型 · 全量权重池
命中层级
往返延迟
能量成本

点一个请求,看它落到哪一层。然后拉下网络开关再试一遍——边与云熄灭,复杂请求被打回,只有端侧底线还活着:这就是「降级模式」。(演示数值)

01

便宜优先

调度目标不是最快或最强,而是「刚好够」:满足质量约束的前提下,选延迟与能耗最低的层级。

02

能力即网络

权重池在网络里而非机器里——换更强的模型不用换机器,就像换自来水厂不用换水龙头。

03

降级有底线

离线时端侧保证听写、本地检索、基础控制可用——故意有限,但绝不为零。代价在论文中如实讨论。