你的智能体无法穿透推理的脱敏层
隐私脱敏可以保留分类准确率,却悄悄破坏多步骤智能体所依赖的实体连续性。修复的关键不在于占位符是否存在,而在于它们的作用域如何划定。
当评审在 A 与 B 之间始终偏袒自己
同厂商的 LLM 评审会让某个 prompt 变体看起来更好,而生产环境却在回退。本文解释为什么家族偏差能骗过所有看板指标, 以及如何用跨厂商集成评审加上人类校准集来修正它。
当评估指标全看“感觉”时,你的 A/B 测试无法区分两个模型
点击率无法区分用户是真心喜爱一个模型还是仅仅在忍受它。在你信任实验结果并据此选择模型之前,请先证明你的指标能够检测出你故意搞坏的模型。
你的评估集里只有你已经解决的问题
你的 LLM 评估分数在攀升,是因为幸存者偏差过滤掉了那些再也没有回来的用户。本文将告诉你如何发现你的评估套件无法察觉的失败案例。
你的模型路由是一个看不见负载的负载均衡器
模型路由在模型执行任何操作之前就决定了由哪个模型处理查询 —— 但它所需的难度信号仅存在于答案中。本文将探讨为什么分类器准确率会带有误导性,为什么错误路由看起来像是平庸的质量而非明显的错误,以及如何监测真正随路由质量波动的下游信号。
提示词 Diff 隐藏了自身的爆炸半径
一个三个单词的提示词修改和一段三个段落的重写在文本 Diff 中看起来并无二致,但其行为后果却大相径庭。为什么提示词审查需要评估增量,而不是字符计数。
为尚未建立职业阶梯的 AI 岗位招聘人才
“评估工程师”(eval engineer)这个头衔在两年前还不存在,因此没有职级标准,也没有完全匹配的简历。围绕真实的失败案例来定义岗位,筛选候选人的判断力而非工具使用能力,从 QA 和平台工程团队进行侧向招聘,并在发出录取通知前先写好职级阶梯。
那些在你没留意时变简单的评估集
一个全员通过的 LLM 评估套件已经失去了衡量意义。探讨为什么静态评估集会趋于饱和、如何识别这一现象,以及如何保持有效的评分梯度。
Eval 测试集是滞后指标:你的绿色仪表盘只反映上季度的失败
仅基于故障复盘(Postmortems)建立的评估套件只能验证你的 AI 系统在过去是安全的。本文将探讨为什么全绿的通过率会在模型迁移当天“撒谎”,以及如何构建探索性评估的覆盖范围。
那个没人同意却成了规范的评估套件
大多数 Agent 团队没有需求文档 —— 评估套件默认成为了规范。为什么全绿的评估运行结果只证明了一个工程师的假设,以及如何以 API Schema 的评审严谨度来对待评估集。
Happy Path 是你的 Agent 评估测试过的唯一路径
94% 的通过率衡量的是你想象成功的能力,而非 Agent 是否真的有效。本文探讨黄金路径偏见如何渗入 Agent 评估套件,以及如何通过故障模式覆盖、生产案例收集和故障注入来解决这一问题。
模型已到生命周期终点,并带走了你的提示词
模型弃用通知看起来只是一个单行配置更改,但你花费六个月调优的提示词是针对特定模型的特性而设计的,无法在切换后继续使用。应将模型生命周期终点视为一个带有可重复运行评估集的周期性迁移项目。