·tian
这场本该成为评测 (Eval) 的会议
“模型是否足够好?”的争论之所以反复出现且无法达成一致,是因为团队在依靠轶事案例进行争辩。本文将介绍如何将这种主观的发布争议转化为一套全团队共同遵守的常设离线指标。
insider
llm-evals
ai-engineering
shipping
+2·tian
删除评估用例是决策,而非清理
为了提升速度或降低成本而裁剪评估套件表面上是维护,但每删除一个用例都意味着放弃了一项团队不再能直观看到的保证。借鉴 API 弃用生命周期,有计划地退役评估用例。
insider
llm-evals
regression-testing
testing
+1·tian
快照追踪测试:将生产环境追踪作为你的回归测试套件
人工筛选的 LLM 评估集在用户行为发生变化的瞬间就会失效。固定生产环境追踪,对输出进行语义等价断言,对工具调用进行结构化相等断言,并使用延迟区间而非点估计。
llm-evals
observability
agents
regression-testing
+1·tian
多模态评估漂移:为什么在文本表现稳定的情况下,图像和音频路径会出现回退
大多数团队将多模态作为其文本产品的薄扩展来发布,并沿用了一套系统性地无法察觉图像或音频回退的评估准则。解决方法是采用单模态评分标准、特定模态的黄金数据集,以及一个拒绝在不同输入类型间聚合质量指标的发布门控。
insider
multimodal
evaluation
vision
+3