·tian
测试无法察觉却破坏了一切的模型升级
你迁移到了更新的模型,所有评估都通过了,延迟也降低了,但支持工单却不断增加。本文将探讨这类能够绕过所有断言的回归问题,以及如何在用户发现之前捕捉到它们。
insider
llm
evaluation
production
+2·tian
多模态评估漂移:为什么在文本表现稳定的情况下,图像和音频路径会出现回退
大多数团队将多模态作为其文本产品的薄扩展来发布,并沿用了一套系统性地无法察觉图像或音频回退的评估准则。解决方法是采用单模态评分标准、特定模态的黄金数据集,以及一个拒绝在不同输入类型间聚合质量指标的发布门控。
insider
multimodal
evaluation
vision
+3·tian
Agent 回填问题:你的模型升级是对过去 90 天的一次审判
当一个更聪明的模型与你已经发布的模型产生分歧时,每一个持久化的 Agent 决策都会变成一个有争议的记录。这是一个关于评估、决策和动作重放的框架 —— 以及你在下次升级前需要的架构先决条件和策略矩阵。
insider
ai-agents
llmops
model-upgrade
+2·tian
智能体能力悬崖:为什么你的模型升级让简单的 95% 变得完美,却让困难的 5% 成了你最糟糕的季度
模型升级提升了你的整体通过率,但同时也让剩余的失败集中在最困难的 5% 流量中 —— 本文将探讨分层评估和能力边界探测如何在这些问题进入你的值班轮值表之前,揭示这种“能力悬崖”。
insider
ai-engineering
evals
llmops
+2