评分了每一轮对话却错过了整个交流:聊聊多轮评估的陷阱
95% 的单轮准确率并不意味着 95% 的会话都能成功。本文将探讨为什么平均单轮得分会掩盖复合失败,以及如何转而对整个对话进行评估。
没有预发布模型的预发布环境
托管模型是你无法建立忠实预发布副本的唯一依赖项。本文将探讨为什么 LLM 的预生产一致性会失效,以及版本固定、重放、黄金转录和影子流量如何分别只能填补部分差距。
不稳定的测试毒化 Agent 循环的速度比伤害人类时快得多
人类对不稳定测试耸耸肩;Agent 却将报错视为绝对真理——回退正确的更改并在虚影上浪费 token。为什么测试确定性现在已成为一项 SLO,以及 Agent 集群如何检测并修复它们所遭受的不稳定测试。
世界没有预发布环境
在 Salesforce、QuickBooks 或 Gmail 上运行的 Agent 实际上是在生产环境中运行的,因为没有其他层级存在。本文探讨了为什么空运行 (dry-run) 标志只是一场戏,供应商沙箱在何处失效,以及如何通过回放代理和模拟租户构建真正的演练层。
确定性种子:为什么供应商将其视为“提示”而非“契约”
托管 LLM API 上的 seed 参数只是尽力而为的提示,而非契约。本文探讨了为什么字节级精确的 CI 断言会失效,以及你应该断言什么。
为什么你的智能体在开发中表现完美,在生产中却状况百出
稀疏的开发测试数据隐藏了生产环境实际会触发的各种行为。在你的智能体面对具有生产级基数和歧义性的数据运行之前,你通过的测试验证的只是一个虚假的世界。
你从未注入过的故障:给你的 Agent 提供一个说谎的工具
你的 Agent 针对超时和 500 错误进行了故障测试,但从未针对过响应快速、格式良好且自信地给出错误答案的工具——这是它最难以发现的故障。
那些在你没留意时变简单的评估集
一个全员通过的 LLM 评估套件已经失去了衡量意义。探讨为什么静态评估集会趋于饱和、如何识别这一现象,以及如何保持有效的评分梯度。
Eval 测试集是滞后指标:你的绿色仪表盘只反映上季度的失败
仅基于故障复盘(Postmortems)建立的评估套件只能验证你的 AI 系统在过去是安全的。本文将探讨为什么全绿的通过率会在模型迁移当天“撒谎”,以及如何构建探索性评估的覆盖范围。
Happy Path 是你的 Agent 评估测试过的唯一路径
94% 的通过率衡量的是你想象成功的能力,而非 Agent 是否真的有效。本文探讨黄金路径偏见如何渗入 Agent 评估套件,以及如何通过故障模式覆盖、生产案例收集和故障注入来解决这一问题。
那个由智能体编写的、实际上什么也没测的测试
编程智能体生成的测试套件能够通过测试、提高覆盖率,却抓不住任何 Bug。本文探讨了为什么智能体编写的测试会演变为同义反复,以及变异测试和红绿 TDD 准则如何让它们重新起到约束行为的作用。
悄然失效的评估:当你的测试套件在衡量一个已不存在的世界
全绿的评估运行可能是在认证过去而非现在。本文探讨评估套件如何衰减,如何区分真正的性能退化与过时的测试,以及如何在套件中构建新鲜度保障机制。