你的评估测试集对现任模型存在过拟合
· 阅读需 12 分钟
一个新的前沿模型发布了。它更便宜、更快速,并在各大公开排行榜上霸榜。你使用你花了 18 个月构建的评估套件对其进行测试,结果它的得分比你目前运行的模型还要差。于是你保留了现有的模型,将挑战者模型归类为“尚未准备好”,然后继续之后的工作。
令人不安的部分在这里:那个结果几乎没有告诉你哪个模型更好。它告诉你的其实是,你的评估套件是通过观察当前模型的失败、处理一次又一次的生产事故而构建的,然后通过修补来消除那些特定的失败。这个套件并不是对质量的客观衡量,它是某个模型“疤痕组织”的目录。而一个拥有不同弱点的挑战者模型,在面对一个针对现有模型特定弱点而收集的测试集时,表现总是会显得更差——即使它在你实际服务的流量上表现得更好。
这就是“现有模型偏见 (incumbent bias)”,它是没人会在迁移决策中计算的切换成本。它在更好的选择出现很久之后,依然悄悄地将你锁定在旧模型上,而且它还是披着“严谨工程”的外衣做到这一点的。
