腐烂的黄金数据集:为什么你的评估集会与产品脱节
最危险的 eval set 是那些依然能通过测试的。变红的 regression suite 会引起关注:有人会打开失败的案例进行争论、修复 Bug 或更新预期。绿色的 suite 则会赢得信任。而这种信任恰恰是失效的 eval set 不配拥有的,因为得分保持绿色并非因为你的系统足够好,而是因为测试已经不再反映用户的真实行为。
这是 AI 评估中一种隐蔽的失败模式。你构建了一个 golden dataset —— 几百个精心标记的案例,代表了产品的工作任务。它能在一整个季度里发挥作用。每次部署都会运行它,每个分数都是绿色,每个人都睡得很香。与此同时,产品发布了三个新功能,企业级流量从查询量的 10% 攀升至 45%,用户开始以 18 个月前团队中没人写过的方式来表达请求。eval set 对此一无所知。它继续根据一个已经不存在的分布对模型进行评分。
