一个优化单一损失函数的模型路由器会准确地交付该损失函数所要求的结果,除此之外别无他求。当该函数的目标是“保持在 p95 延迟目标之下”时,每一个本可以从深度推理(extended reasoning)中获益的查询都会被强行分配到路由器能辩护的最廉价路径上,因为快速模型能在 SLO 范围内返回,而缓慢但正确的模型则不能。延迟仪表板变绿了。综合评估指标(aggregate eval)仅波动了不到一个百分点,团队便将其视为噪声忽略不计。而没人绘图的分片视图(per-slice view)才是真正发生质量回归(regression)的地方:它集中在那些多步骤、模糊且分布外(out-of-distribution)的查询中,这些查询本应被路由到推理模型,结果却分配给了那些运行迅速但错误得很有底气的模型。
这不是路由 bug。路由器正在准确地执行其设计任务。Bug 出在框架设定上——如果一个系统的优化器完全以延迟为基准,它就会产生质量回归,而这些回归在团队为了 KPI 而维持“绿色”的指标中是不可见的。随后,它会默默地发布这些回归,因为盯仪表板的人并不是盯答案的人。
单目标陷阱
在你构建它时,延迟预算路由看起来很合理,是因为延迟是一个干净、直接、服务器端的信号。路由分类器预测能在截止日期前返回的最廉价模型,仪表板也会实时更新。而质量则完全不同。质量的反馈滞后数小时或数天,需要人工或 LLM 裁判(LLM-judge)评分,并且以不同分布独立移动的查询类别进行汇总。将延迟放入目标函数而将质量放在下游评估中,这并不是一个设计决策——它是阻力最小的工程实施路径(path of least instrumentation resistance)。
陷阱在于,路由决策在你将要进行的每一次质量测量中都处于因果上游 。一旦廉价路径给出了答案,代价昂贵的路径就不会再运行。除非团队预先构建了对照组,否则没有“反事实(counterfactual)”可以比较,而大多数团队并不会这样做——为每个查询同时运行两个模型并评估差异的影子基础设施(shadow infrastructure),恰恰是路由器本应避免的成本。因此,回归在仪表板没有切片的客群中累积,团队对“质量”的理解简化为“我在周末看到的综合得分,其波动幅度还不如噪声底限(noise floor)大”。
最近关于多目标服务(multi-objective serving)的研究——例如 BOute 等贝叶斯优化框架,以及 PROTEUS 等拉格朗日强化学习(Lagrangian-RL)控制器——明确地界定了这一点:路由是一个至少具有三个维度(成本、延迟、质量)的受限优化问题。将其中任何一个视为损失函数,而将其他指标留给“我们会观察仪表板”,在数学上等同于给后者分配了零权重。无论团队意图如何,路由器服务的模型都会反映出这些权重。
为什么综合评估会欺骗你
假设候选的路由更改将 60% 的流量从推理模型转移到快速模型。假设快速模型在路由器分类器识别为“简单”的 80% 查询上确实达到了同等水平(parity)。假设在剩余的 20%——即分类器识别错误的查询、边界查询以及分布外(OOD)的长尾查询——快速模型明显更差。
综合评估得分:80% × 持平 + 20% × 显著回归。如果评估套件的分布与生产流量一致,那么标题数字(headline number)的变动幅度仅占受影响分片回归幅度的一小部分。如果受影响的分片占生产流量的 5%,且其回归幅度为 15 分,那么综合得分仅移动 0.75 分——这完全处于团队一直校准的噪声范围之内。PR 发布了,仪表板保持绿色,而受到冲击的分片足够小,以至于支持团队将症状(工单解决时间变长、更多投诉升级、更多“AI 没听懂我的问题”的反馈)视为与三周前的路由更改无关的独立现象。
在任何团队将多目标系统压缩为单一标题指标的地方,都会出现这种相同的失败模式。这并非 AI 所特有。AI 的特殊之处在于,受影响的分片——那些多步骤、模糊、分布外的查询——也是团队产品策略隐含押注的客群,因为每一个简单的查询也都是非 AI 产品可以处理的。路由器悄悄降级的部分,恰恰是证明路由器存在意义的核心价值。
推理准入通道
弥补这一差距的模式是停止将“该查询是否应该进入推理?”视为预算决策,而是将其视为在预算逻辑之前运行的分类决策。推理准入分类器(reasoning-eligibility classifier)——最近的混合 LLM 路由器将其描述为“思考还是不思考(to think or not to think)”头部——接收传入的查询,预测推理模型是否可能产生显著更好的答案,并将符合条件的查询固定到推理路径上,而不论当前窗口剩余多少延迟预算。
机械上的变化很小。语义上的变化却很大:它将优先级顺序从“除非你能证明推理是值得的,否则保持在延迟范围内”反转为“当分类器认为重要时使用推理,并吸收该客群的延迟冲击”。延迟仪表板现在有了一个已知的底线——分类器发送到推理路径的客群 p95 必然比发送到快速路径的客群差,而这是预期的状态,而不是回归。综合延迟目标现在是准入分类器校准的一个属性,而不是路由器妥协意愿的属性。
两个设计点决定了这一通道是否有效。首先,分类器必须针对你真正关心的信号进行训练——不是“这个查询感觉难吗”,而是“推理模型的答案在用户实际评估的指标上是否会优于快速模型的答案”——这意味着训练数据是由以结果为锚点的裁判(outcome-anchored judge)评分的补全对,而不是提示词的启发式特征。其次,准入分类器的校准漂移必须独立于延迟仪表板进行监控,因为无声破坏这种设计最简单的方法,就是让分类器的“应推理”率随时间逐渐下降,因为它会向正在训练它的任何反馈循环的廉价路径偏见漂移。
分片 SLO,否则你就是在针对聚合指标进行优化 一旦资格通道(eligibility lane)建立,质量 SLO 就必须进行分片以与之匹配。一个将整个路由器的质量 SLO 设定为“版本间回归不超过 0.5 分”的聚合指标,是可以被这样的系统满足的:它在“推理适用组”(reasoning-eligible cohort)上出现了 15 分的回归,但在“简单组”上实现了 1 分的提升 —— 加权平均后结果被抵消了,团队的仪表板显示一切正常。然而,团队产品被评判的核心群体,恰恰是那个 SLO 未能保护的群体。
分片式的修正方案是:在推理适用组上定义比聚合指标更严格的 SLO,并拒绝将聚合指标的波动解读为系统的质量全貌。数字是具体的:如果推理组占流量的 20%,且团队的产品假设认为推理组是 AI 边际价值所在,那么即使聚合指标在任何方向上波动了 1 分,该组 5 分的回归也应被视为阻断发布的事件。仪表板必须首先呈现分片层级的数字,其次才是聚合数字,因为聚合指标正是优化器已经在试图“刷分”的目标。
这听起来像是仪表板的修饰,实则不然。团队将核心数字放在哪里,注意力就会随之投向哪里;而你关注哪里,下一季度的路由变更就会针对哪里进行优化。如果一个团队的首要质量指标是聚合指标,那么在几个发布周期内,他们就会构建出一个以聚合指标为损失函数的路由器。分片 SLO 是防止路由器出现长尾回归的唯一屏障,而这种回归在结构上对路由器所针对的优化指标是不可见的。
路由审计 将这一切串联起来的监测手段是路由审计。它会将团队通常拥有但很少关联的三项数据按查询进行合并:路由器实际采取的路径、路由时的资格分类器预测,以及用户感知的结果(解决/放弃/升级/发起更正)。有了这三列数据的关联,团队就能构建出真正重要的群体:分类器认为适用推理、但路由器因预算紧张而发送到低成本路径、随后用户给出负面评价的查询。
这个群体就是“证据”(the receipts)。它是对“延迟的提升让我们付出了什么代价?”这一问题的回答,且是以用户行为而非评估分数来衡量的。实际上,这也是支持团队在工单队列中一直看到但无法解释的群体 —— 那些“AI 以前能处理,现在不行了”的投诉,由于破坏它们的发布是路由调整而非模型变更,且路由层并不在团队对“发布用户可见行为”的认知模型中,因此这些投诉无法与任何明显的发布版本挂钩。
一旦建立了这种审计机制,团队就会发现无法再按老路发布路由变更,因为曾经不可见的群体变成了审计屏幕上的焦点。尚未建立这种机制的团队将不断发布同样的回归,将其归因于供应商漂移或评估噪声,并说服自己那片绿色的延迟仪表板就是全貌。
架构层面的觉悟 “延迟预算路由器”本质上就是“质量损失路由器”。那些在每次时钟压力下都选择低成本路径的团队,正在发布一个 SLO 上的胜利,而其代价则隐藏在仪表板从未分片过的流失群体中。没有任何路由器设计能逃脱多目标问题 —— 每一个路由决策都是在用一种东西交换另一种东西 —— 但有的设计会揭示这种权衡,而有的设计则会隐藏它。前者让团队能够针对哪些查询应走哪条路径做出深思熟虑的决策;后者则会自动做出决策,倒向损失函数中的任何目标,并将结果呈现给团队,仿佛那是唯一的可能性。
这里的准则是拒绝用单一指标来衡量路由。多目标优化比“我们将 P95 降低了 200 毫秒”更难监测、更难做仪表板、也更难在发布说明中解释。但它也是唯一一种在结构上不会将负载推向最不可见的质量群体的框架。延迟是约束,成本是约束,而推理适用组的质量才是 AI 获得报酬的原因 —— 一个将其视为残差的路由器,最终将在预算电子表格的注释中,替团队决定产品的战略走向。
做对这件事的团队通常都有相似的特征:前端有一个按利害关系分类的资格通道,一个聚合指标无法抵消的分片质量 SLO,一个关联决策与结果的路由审计,以及一个将推理组视为一等回归目标(而非仪表板变绿后再处理的尾部问题)的发布流程。这一切都不会让延迟数字变得更好,但它们让延迟数字不再仅仅意味着“我们通过悄悄提供更差的答案而变得更快”。
会员专享
余下内容仅对会员开放。 会员可读完整内容 —— 每一个公开发布的观点背后,那些框架、决策与推理的全貌。
— 完整文章,包含未公开存档的部分 — 可落地的工作框架,附带权衡与决策依据 — 新文章抢先看,先于公开发布 登录以继续阅读→ 随时取消 · 一次订阅,畅读全部