任务完成率指标变绿,而用户却在默默受苦
94% 的任务完成率仪表板可能一直显示绿色,但与此同时 Agent 正在消耗大量 Token、反复回溯并让用户感到疲惫。为什么完成率是一个错误的指标,以及四个能洞察其盲点的轨迹指标。
当测试集泄露到微调中:你自己造成的污染
基准测试污染通常归咎于模型厂商,但最严重的泄露往往是你自己的团队造成的 —— 故障分流、合成数据以及共享的 RAG 语料库,这些因素正悄无声息地将评估案例转移到训练中。
当廉价模型变得更昂贵时
将流量路由到较小的模型虽然降低了每 token 的成本,但可能会增加每个完成任务的成本。本文将分析节省的成本是如何流失的 —— 以及你如何在发布前进行衡量。
PM 与评测之间的翻译鸿沟:当发布决策超越了词汇表
评测分数是 AI 质量的一种有损压缩,而负责发布的产品经理往往无法将其解压缩。本文将为你提供一座扫盲桥梁,让发布决策锚定在数据之上,而不是取决于谁的声音最大。
当“智能体能做 X 吗?”演变为交付承诺时
当“运行成功一次”的说法经过每日站会、路线图和销售电话后,AI 能力探针会悄然演变为路线图承诺。本文介绍了一套能力测试产物和晋级关卡,旨在防止演示原型在不成熟时就变成合同条款。
内部评估集:一个无人审查的隐私边界
AI 团队通常根据生产环境的对话来评估模型,并将其称为内部数据集。根据目的限制原则,这其实是一个未经审查的独立数据处理环节。
重复问题检测:你的单轮评估无法察觉的会话级盲点
单轮评估分数可以保持在绿色状态,但用户可能在三次重新表述同一个问题后流失。这种失败发生在会话层面——这里告诉你如何检测和评分。
过时的 Few-Shot 示例以及你的提示词仓库所忽略的半衰期
你系统提示词中的经典示例正在悄悄地教导模型一个已不存在的产品。评估分数之所以保持绿色,是因为评估集也随之腐化了。
AI 代码审查漂移:当你的 LLM 审查标准比代码演进得还快
LLM 代码审查器并非一个稳定的工具 —— 它是由多个独立漂移的组件组成的堆栈。本文将探讨为什么你的 PR 机器人捕获率会悄无声息地下降,以及哪些校准纪律能防止安全网变薄。
提示词组合:管理一组提示词,而非单一的最佳提示词
生产环境中的提示词管理通常只选取单一的最优解。应当将其视为一个投资组合:通过加权变体、感知分段的分配以及每周再平衡来进行管理。
升级率:离线测试遗漏的评估信号
升级率是衡量智能体能力的少数真实信号之一,但在大多数公司中,它存在于运营团队的人员配置仪表板上,而不是 AI 团队的评估审查中。以下是缩小这一差距的方法。
Agent 分支覆盖率:你的评测仅命中了 Happy Path,而非 Planner 的 If-Else 逻辑
Agent Prompt 中隐藏了评测套件从未执行过的 If-Else 分支。借鉴 MC/DC 的严谨性,通过分支 ID 监测 Planner 的决策,并基于覆盖率对 Prompt Diff 进行拦截,防止隐性的路由错误流入生产环境。