·tian
披着“延迟预算路由器”外衣的“质量损失路由器”
一个延迟预算路由器完全按照其损失函数的要求运行,却在无形中降低了符合推理要求的样本群体的质量。本文探讨了为什么聚合评估会掩盖这种性能回退,以及应该如何配置监控手段。
insider
llm-routing
slo
evaluation
+1·tian
你的模型路由是一个看不见负载的负载均衡器
模型路由在模型执行任何操作之前就决定了由哪个模型处理查询 —— 但它所需的难度信号仅存在于答案中。本文将探讨为什么分类器准确率会带有误导性,为什么错误路由看起来像是平庸的质量而非明显的错误,以及如何监测真正随路由质量波动的下游信号。
llm-routing
model-cascades
evaluation
production-ml
+1·tian
推理模型套利:在处理难题时,慢速昂贵模型反而更省钱
按 Token 计价仅反映了中位请求的成本,而非你产品实际服务分布的全额成本。一旦重试、人工介入和信任损失计入损益表,将复杂提示词路由至推理模型便会胜过默认使用通用模型。
insider
llm-routing
ai-cost
model-selection
+2·tian
模型路由中的 20% 问题:当成本优化产生二等用户时
经过成本优化的 LLM 路由正悄然在特定用户群体间造成质量差距。了解为什么那 20% 被升级处理的查询并非随机分布,如何按用户分层审计路由层级,以及如何设计带有公平性约束的策略。
insider
llm-routing
ai-fairness
cost-optimization
+1·tian
你的模型路由是基于评估集训练的,而不是你的真实流量
基于基准测试训练的路由器会带来隐蔽的质量退化:低成本路径在宏观数据上表现尚可,但在你的评估套件从未采样的少数关键用户群体中却会失败。本文探讨了为什么路由器是一个控制系统而非分类器,以及实现闭环处理究竟需要什么。
insider
llm-routing
model-cascades
evaluation
+1·tian
路由即产品:为什么你的低成本分类器比旗舰模型决定了更多行为
成本感知型 LLM 路由让低成本模型成为了大多数用户的实际产品面。如果你的评估体系仍聚焦于旗舰模型,那么你在 70% 的流量上都是盲目的 —— 这里有能解决该问题的“路由即产品”框架。
llm-routing
ai-engineering
evals
observability
+1·tian
级联路由的可靠性陷阱:当成本优化悄然摧毁你的 p95 延迟
级联路由能够显著降低 LLM 开销 —— 但同时也会悄然降低尾部延迟、污染你的训练数据并使 A/B 测试失效。在成本收益变成可靠性账单之前,以下是你需要进行观测的指标。
insider
llm-routing
observability
reliability
+1