Noeton 落地路线 05 / 05

端·边·云分层认知:苹果已经做了一半,P/D 分离做了另一半

2026 年 6 月 12 日

L4 网络织物 · 分层认知是论文最有争议的一层:端侧只保底线,完整能力来自网络化的权重池,请求落在能满足它的最便宜层级(亲手体验:端边云路由实验)。有趣的是,这条原则的两个组成部分,已经分别被业界做出来了——只是还没有人把它们拼在一起。

苹果做了「端 ↔ 云」这一半

Apple Intelligence 的架构几乎就是 L4 的教科书插图:端侧约 3B 量级的模型处理低延迟任务,超出能力的请求升级到 Private Cloud Compute——苹果自研芯片的云端集群,并以可验证的隐私设计回应「数据离开设备」的质疑。注意它与论文的两处一致:其一,端侧模型刻意「够用就好」,能力上限明确让位给云端;其二,升级决策对用户透明,用户表达意图,系统决定层级。

端侧的硬件底座也已就位:高通骁龙 X Elite 级别的 NPU 普遍达到 40+ TOPS,3B 级小模型(Qwen、MiniCPM、Phi 系列)在手机/PC 上流畅运行已是常态——「降级模式的底线」技术上完全成立。

推理系统做了「层内分域」这一半

另一半来自数据中心内部:微软的 Splitwise、北大的 DistServe 论证了 prefill/decode 分离的收益,而 Mooncake 把它做成了支撑 Kimi 线上流量的生产系统——同一个请求的两个阶段,已经在不同的机器池上完成(原理可视化:Split Inference 实验)。论文说「一次请求甚至可以把 prefill 与 decode 放在不同层级」,生产系统已经在单层内做到了,跨层只是延迟预算问题。

国内的独特变量:边缘层

中国市场有一个常被忽略的优势:运营商的 MEC(边缘计算)节点密度和城市光纤覆盖。论文设想的「边缘权重池」(区域共享的中型模型,十毫秒级往返)在国内一二线城市的网络条件下是成立的——这恰是欧美市场难以复制的一层。

卡点:没有跨层的「便宜优先」调度器

三层各自都在变好,但没有一个调度器同时看见三层。今天的升级决策要么写死在客户端(苹果),要么局限在数据中心内(Mooncake)。「满足质量约束的最低成本层级」需要一个跨层的代价模型:延迟、能耗、隐私等级、当前负载——这正是空白地带。

交互演示:同一股请求流,两种账单

下面是一股持续到来的请求流(60% 轻、30% 中、10% 重)。切换两种策略,盯住右侧的累计成本——「便宜优先」不是性能优化,是经济学。这正是我们要做的跨层调度器的最小演示。

论文精读

跨层路由与端云协同的 5 篇关键文献:

arXiv 2023 · StanfordFrugalGPT: How to Use LLMs While Reducing Cost and Improving Performance

LLM 级联调用的开山之作:先用便宜模型,置信度不足再升级到贵模型,配合提示适配与缓存,在多个任务上以约 2% 的成本逼近最强单模型的质量。

→ 对 Noeton:「便宜优先」调度的可行性证明——质量约束下的成本最小化是可学习的。
ICLR 2024 · 微软Hybrid LLM: Cost-Efficient and Quality-Aware Query Routing

训练一个轻量路由器在「小模型 / 大模型」之间预判分流,在质量几乎无损的前提下把大模型调用量削减约 40%。证明路由决策本身可以又便宜又准。

→ 对 Noeton:L4 调度器的核心组件(难度预判器)有了监督学习配方。
arXiv 2024 · UC Berkeley (LMSYS)RouteLLM: Learning to Route LLMs with Preference Data

用人类偏好数据训练路由器,并提出路由器的跨模型对泛化能力——换底层模型不必重训路由器。开源了完整框架与评测。

→ 对 Noeton:跨层调度器应当与具体模型解耦——「层级抽象」而非「模型绑定」。
ISCA 2024 · 微软研究院Splitwise: Efficient Generative LLM Inference Using Phase Splitting

生产数据证明 prefill(算力密集)与 decode(带宽密集)应分池部署,异构机型各司其职,同成本下吞吐显著提升。

→ 对 Noeton:层内分域已是工业共识——把同样的分域逻辑抬升到端边云三层,是 L4 的自然外推。
ICML 2024 · MetaMobileLLM: Optimizing Sub-billion Parameter LLMs for On-Device Use Cases

系统研究 10 亿参数以下模型的架构设计空间(深窄结构、嵌入共享、分组注意力),证明端侧小模型的能力密度还有可观挖掘空间。

→ 对 Noeton:「端侧底线」的高度由小模型科学决定——底线越高,降级模式越体面。

Noeton 的落地方案

  1. 定义层级无关的请求描述:每个请求携带质量约束(延迟上限、隐私等级、能力需求),而非指定执行位置——这是「便宜优先」调度的前提;
  2. 做一个三层调度器的参考实现:端侧用 3B 级开源小模型,云端接 vLLM/Mooncake 集群,边缘层先用区域机房模拟;路由器按 Hybrid LLM/RouteLLM 的配方训练,代价模型开源,让「便宜优先」可被复现与审计;
  3. 把降级模式做成产品特性而非故障态:离线时端侧明确告知能力边界(参照我们断网开关实验的交互),把论文直面的「自主性代价」转化为透明的用户契约。

一句话:L4 不需要发明任何新部件——苹果证明了端云分层,Mooncake 证明了阶段分域,路由论文给出了调度配方;Noeton 要做的,是那个同时看见三层的「便宜优先」调度器。


行业动态参考:Mooncake 论文 · vLLM × Mooncake · 本系列:01 存内计算 · 02 CXL 池化 · 03 数据流 · 04 Model-OS