跳转到主要内容

披着“延迟预算路由器”外衣的“质量损失路由器”

阅读需 1 分钟Tian PanTian Pan

一个优化单一损失函数的模型路由器会准确地交付该损失函数所要求的结果,除此之外别无他求。当该函数的目标是“保持在 p95 延迟目标之下”时,每一个本可以从深度推理(extended reasoning)中获益的查询都会被强行分配到路由器能辩护的最廉价路径上,因为快速模型能在 SLO 范围内返回,而缓慢但正确的模型则不能。延迟仪表板变绿了。综合评估指标(aggregate eval)仅波动了不到一个百分点,团队便将其视为噪声忽略不计。而没人绘图的分片视图(per-slice view)才是真正发生质量回归(regression)的地方:它集中在那些多步骤、模糊且分布外(out-of-distribution)的查询中,这些查询本应被路由到推理模型,结果却分配给了那些运行迅速但错误得很有底气的模型。

这不是路由 bug。路由器正在准确地执行其设计任务。Bug 出在框架设定上——如果一个系统的优化器完全以延迟为基准,它就会产生质量回归,而这些回归在团队为了 KPI 而维持“绿色”的指标中是不可见的。随后,它会默默地发布这些回归,因为盯仪表板的人并不是盯答案的人。

单目标陷阱

在你构建它时,延迟预算路由看起来很合理,是因为延迟是一个干净、直接、服务器端的信号。路由分类器预测能在截止日期前返回的最廉价模型,仪表板也会实时更新。而质量则完全不同。质量的反馈滞后数小时或数天,需要人工或 LLM 裁判(LLM-judge)评分,并且以不同分布独立移动的查询类别进行汇总。将延迟放入目标函数而将质量放在下游评估中,这并不是一个设计决策——它是阻力最小的工程实施路径(path of least instrumentation resistance)。

陷阱在于,路由决策在你将要进行的每一次质量测量中都处于因果上游。一旦廉价路径给出了答案,代价昂贵的路径就不会再运行。除非团队预先构建了对照组,否则没有“反事实(counterfactual)”可以比较,而大多数团队并不会这样做——为每个查询同时运行两个模型并评估差异的影子基础设施(shadow infrastructure),恰恰是路由器本应避免的成本。因此,回归在仪表板没有切片的客群中累积,团队对“质量”的理解简化为“我在周末看到的综合得分,其波动幅度还不如噪声底限(noise floor)大”。

最近关于多目标服务(multi-objective serving)的研究——例如 BOute 等贝叶斯优化框架,以及 PROTEUS 等拉格朗日强化学习(Lagrangian-RL)控制器——明确地界定了这一点:路由是一个至少具有三个维度(成本、延迟、质量)的受限优化问题。将其中任何一个视为损失函数,而将其他指标留给“我们会观察仪表板”,在数学上等同于给后者分配了零权重。无论团队意图如何,路由器服务的模型都会反映出这些权重。

为什么综合评估会欺骗你

假设候选的路由更改将 60% 的流量从推理模型转移到快速模型。假设快速模型在路由器分类器识别为“简单”的 80% 查询上确实达到了同等水平(parity)。假设在剩余的 20%——即分类器识别错误的查询、边界查询以及分布外(OOD)的长尾查询——快速模型明显更差。

综合评估得分:80% × 持平 + 20% × 显著回归。如果评估套件的分布与生产流量一致,那么标题数字(headline number)的变动幅度仅占受影响分片回归幅度的一小部分。如果受影响的分片占生产流量的 5%,且其回归幅度为 15 分,那么综合得分仅移动 0.75 分——这完全处于团队一直校准的噪声范围之内。PR 发布了,仪表板保持绿色,而受到冲击的分片足够小,以至于支持团队将症状(工单解决时间变长、更多投诉升级、更多“AI 没听懂我的问题”的反馈)视为与三周前的路由更改无关的独立现象。

在任何团队将多目标系统压缩为单一标题指标的地方,都会出现这种相同的失败模式。这并非 AI 所特有。AI 的特殊之处在于,受影响的分片——那些多步骤、模糊、分布外的查询——也是团队产品策略隐含押注的客群,因为每一个简单的查询也都是非 AI 产品可以处理的。路由器悄悄降级的部分,恰恰是证明路由器存在意义的核心价值。

推理准入通道

弥补这一差距的模式是停止将“该查询是否应该进入推理?”视为预算决策,而是将其视为在预算逻辑之前运行的分类决策。推理准入分类器(reasoning-eligibility classifier)——最近的混合 LLM 路由器将其描述为“思考还是不思考(to think or not to think)”头部——接收传入的查询,预测推理模型是否可能产生显著更好的答案,并将符合条件的查询固定到推理路径上,而不论当前窗口剩余多少延迟预算。

会员专享

余下内容仅对会员开放。

会员可读完整内容 —— 每一个公开发布的观点背后,那些框架、决策与推理的全貌。

  • 完整文章,包含未公开存档的部分
  • 可落地的工作框架,附带权衡与决策依据
  • 新文章抢先看,先于公开发布

随时取消 · 一次订阅,畅读全部

参考资料

保持联系,关注我获取更多内容

阅读需 12 分钟

供应商移除的 Logprobs 字段如何静默地破坏了你的置信度路由

一个不再升级低置信度回答的置信度路由,导致该问题的供应商静默层级变更,以及响应结构契约、群体级告警和针对错误故障模式编写的回退机制是如何共同掩盖问题的。

insider
llm
阅读需 9 分钟

你定义‘首个 Token’的位置决定了你的延迟 SLO 是否真实

p99 首个 Token 延迟低于 800 毫秒看起来像是一个承诺——直到推理层的切换悄然重新定义了‘首个 Token’的含义。SLO 衡量的是供应商边界;而用户的感受则完全不同。

insider
llm-ops
阅读需 10 分钟

你的模型路由是基于评估集训练的,而不是你的真实流量

基于基准测试训练的路由器会带来隐蔽的质量退化:低成本路径在宏观数据上表现尚可,但在你的评估套件从未采样的少数关键用户群体中却会失败。本文探讨了为什么路由器是一个控制系统而非分类器,以及实现闭环处理究竟需要什么。

insider
llm-routing
阅读需 9 分钟

级联路由的可靠性陷阱:当成本优化悄然摧毁你的 p95 延迟

级联路由能够显著降低 LLM 开销 —— 但同时也会悄然降低尾部延迟、污染你的训练数据并使 A/B 测试失效。在成本收益变成可靠性账单之前,以下是你需要进行观测的指标。

insider
llm-routing
阅读需 12 分钟

Eval 异味目录:让你的 LLM 评估套件比没有评估还糟糕的反模式

一份关于毒害 LLM 评估套件的反模式实战指南 —— 包括数据污染、脆弱的断言、评估腐化、评委合谋、虚荣聚合指标 —— 以及在无需重写整个测试框架的情况下恢复有效信号的重构模式。

insider
ai-engineering