不存在的单一质量指标
在你公司的某个地方,有一张幻灯片上写着一个数字。“AI 质量:87”。上个季度这个数字是 85,所以幻灯片是绿色的。与此同时,你的值班频道里塞满了截图,显示助手正在自信地为你的最大企业客户捏造退款政策。这两件事同时发生,而撒谎的是那张幻灯片。
这张幻灯片背后的管理层需求完全合情合理:给我一个可以追踪的分数,让我知道这玩意儿是在变好还是变坏。这在收入和可用性上行得通,但在 AI 功能上行不通。因为 AI 功能的质量不是一个标量 —— 它是在输入、用户和时间维度上的分布。将这种分布平均成一个数字并不能起到总结作用,反而精准地破坏了决策者所需的信息。
这篇文章讨论的是这两个事实之间的差距:为什么你的评估套件(eval suite)的平均值隐藏了那些真正伤害你的回归(regressions),你应该汇报什么,以及如何向董事会报告的受众展示一个本质上存在波动的指标,且不会在指标下降的第一周就毁掉你的信誉。
