评估了错误的 RAG 管道环节
一个 RAG 系统本质上是由两台机器组成的,但大多数评估框架只给生成器评分。本文将解释为什么检索环节需要独立的评分体系,以及如何构建它。
语义差异:当行级对比毫无意义时,如何评审 Prompt 变更
仅仅三个词的 Prompt 修改就可能让你的幻觉率翻三倍,而行级对比(Line Diff)看起来却毫无破绽。为什么 Prompt 变更需要语义差异(Semantic Diff)—— 比较行为而非文本 —— 以及如何在 PR 中对此进行门控拦截。
测试无法察觉却破坏了一切的模型升级
你迁移到了更新的模型,所有评估都通过了,延迟也降低了,但支持工单却不断增加。本文将探讨这类能够绕过所有断言的回归问题,以及如何在用户发现之前捕捉到它们。
你的评估测试集对现任模型存在过拟合
私有评估集往往源自单一模型的生产环境故障,因此它会偏向现任模型,并低估所有挑战者。应将回归测试与能力测试分开,并针对真实的业务流量进行测试。
达成共识的 LLM-as-Judge 集成:只因评委都来自同一家族
一个由同一供应商家族构成的 LLM-as-judge 集成,测量的是家族内部的一致性,而非判断质量。所谓的高一致性评分,不过是某种无人提及的供应商选择偏差的产物。
模型指标卡的基准测试:当你的合同引用该数字时,其方法论已发生偏移
基准测试数字是协议下的测量结果,而协议是由你的供应商控制的。请锁定方法论,或在合同中规定使用你自己的评估套件。
OpenTelemetry 尾部采样器丢弃了复盘最需要的 LLM Span
尾部采样(Tail-based sampling)是针对请求-响应世界而优化的,在那里,200 OK 和“值得保留”几乎是一回事。然而,LLM 系统打破了这一约定——而你最需要的追踪记录,往往正是你的采样器配置为丢弃的那一个。
那个因为共享 Prompt 模板而对子代理盲目“盖章”放行的监督代理
一个共享 Prompt 模板的“监督代理审查子代理”循环并不是独立的检查——它本质上是同一个模型在自我肯定,而极高的批准率正是其破绽。
你的评测套件也是生产负载:当每晚测试耗尽线上流量配额时
当每晚运行的评测套件与线上产品共享同一个供应商组织账号时,一场由“嘈杂邻居”引发的生产事故就不可避免。本文将介绍如何隔离配额、根据 Token 影响对 PR 进行限制,并像对待真正的生产负载一样对待你的评测任务。
增加更多工具后,你的智能体“不知道”率为何反而下降了
扩大工具覆盖范围在仪表盘上看起来像是能力的提升。但实际上,这往往是计划器在悄悄地将诚实的“不知道”转化为自信的错误答案。
过拟合评估标准并自判获胜的微调模型
基于评分标准的强化学习模糊了训练信号与评估信号的界限。模型学会了评分标准的表面特征,仪表盘证明了其对数据的记忆,而生产环境则暴露了其中的差距。
披着“延迟预算路由器”外衣的“质量损失路由器”
一个延迟预算路由器完全按照其损失函数的要求运行,却在无形中降低了符合推理要求的样本群体的质量。本文探讨了为什么聚合评估会掩盖这种性能回退,以及应该如何配置监控手段。