跳到主要内容

腐烂的黄金数据集:为什么你的评估集会与产品脱节

· 阅读需 10 分钟
Tian Pan
Software Engineer

最危险的 eval set 是那些依然能通过测试的。变红的 regression suite 会引起关注:有人会打开失败的案例进行争论、修复 Bug 或更新预期。绿色的 suite 则会赢得信任。而这种信任恰恰是失效的 eval set 不配拥有的,因为得分保持绿色并非因为你的系统足够好,而是因为测试已经不再反映用户的真实行为。

这是 AI 评估中一种隐蔽的失败模式。你构建了一个 golden dataset —— 几百个精心标记的案例,代表了产品的工作任务。它能在一整个季度里发挥作用。每次部署都会运行它,每个分数都是绿色,每个人都睡得很香。与此同时,产品发布了三个新功能,企业级流量从查询量的 10% 攀升至 45%,用户开始以 18 个月前团队中没人写过的方式来表达请求。eval set 对此一无所知。它继续根据一个已经不存在的分布对模型进行评分。

这种失败之所以具有欺骗性,恰恰是因为它不会发出警报。模型 regression 是响亮的 —— 指标下降、仪表盘变红、有人收到报警。eval drift 则是无声的。没有任何东西损坏,检查持续通过,而你正蒙着眼睛飞行,仪表盘却显示一切正常。在失效的集合上获得通过分数比完全没有评估更糟糕,因为“没有评估”会让你谨慎,而绿色的对勾会让你自信。人为制造的信心往往代价高昂。

Eval Set 是活的资产,而非固定装置

大多数团队最初的思维模型是错误的。他们把 golden dataset 当成 unit test:编写一次,提交,并永远信任它,因为输入和预期输出是固定的。当被测试对象是 deterministic 的且它所建模的世界是静态时,这种方法奏效。但这两点对于 AI 产品来说都不成立。

你的 eval set 所建模的世界是真实用户行为的分布,而这种分布是变动的。当你添加新功能、进入新市场、竞争对手宕机给你带来一波陌生的用户,或者一篇爆红的帖子教会了人们一种新的提问方式时,它都会发生变动。你标记的案例是某一时刻用户行为的照片。而照片是会老化的。

因此,正确的思维模型更接近花园而非固定装置。它需要除草、补种和季节性的照料。eval set 有维护成本,如果你不预算这部分成本,你并不是在节省精力 —— 你只是将其推迟到一种更难检测的失败类别中。做法正确的团队会将数据集视为与代码具有相同治理地位的一等公民:它有版本控制,对 ground truth 的更改需要经过代码审查,删除或修改标记案例被视为生产风险,而非简单的家务杂事。

腐烂的三种方式

Decay 并非只有一种形式。它至少以三种截然不同的模式出现,且需要不同的应对措施。

Coverage gaps 随着产品的增长而出现。每一个新功能都会引入 original set 从未采样过的 intents、entities 和 edge cases。你上线了一个摘要功能,但你的 eval set 里一个摘要案例都没有。分数依然是绿色,因为现有的案例依然能通过 —— 但现在的“绿色”意味着“我们测试了去年存在的 80% 的产品功能”。那未经测试的 20% 才是新 Bug 滋生的地方,而且从结构上看,你的 eval 对你最可能破坏的代码恰恰是视而不见的。

Stale labels 随着 ground truth 在底层发生漂移而累积。 “好”答案的定义不是固定不变的。去年正确的回答现在可能由于政策变更、事实改变、下游系统调整或你自身产品对质量认知的成熟而变得错误。案例依然在运行,依然将模型输出与存储的预期进行对比,并依然报告通过或失败 —— 但预期本身已经成为了化石。更糟糕的是,如果一个被弃用的行为其案例仍计入评分,它会因为模型做了正确的事情而惩罚模型。

Distribution skew 是最微妙且后果最严重的。在这种情况下,你的案例单独来看都是有效的,标签也是正确的,但其 mix 不再符合生产环境。你的集合中有 60% 是简单的 lookups,因为这些案例很容易编写;而现在生产环境则由多步推理查询占据主导。总分是在错误的权重下进行的加权平均。这并非假设:Meta AI 的研究发现,偏向简单查询的评估数据集高估了生产环境 RAG 质量,一旦在真实的查询分布上进行衡量,准确率会下降 25% 到 30%。你的 eval 说是 90 分,现实却是 60 分,差距完全在于采样。

还有第四种值得一提的自找模式:overfitting to the set itself。如果你的 eval 从未改变,每一次 prompt tweak 和模型更换都会针对那几百个案例进行优化,直到系统学会了如何应付测试,而不是如何完成任务。一个冻结的 golden set 不仅会过时 —— 它还会变成一个被追逐的指标,而 Goodhart's law 会完成剩下的破坏。

加载中…
References:Let's stay in touch and Follow me for more thoughts and updates