模型停滞不前,用户却在持续偏移
发布六周后,你的质量仪表盘开始下滑。点踩率攀升,任务完成率下降,值班频道里塞满了糟糕回复的截图。团队做了该做的一切:对比 Prompt(未变),检查模型版本(已锁定),审计检索索引(是最新的),并对部署历史进行二分查找(没有任何发布)。大家一致认为模型提供商悄悄降低了模型性能。当然,提供商坚持说没有任何变动。
大家都找错了地方。系统没有任何改变,改变的是用户。
发布周的指标是基于发布周的用户假设的。但人们会在几周内适应一款 AI 产品,而这种适应方式会系统性地破坏你在 Prompt、评估集(Evals)和发布基准测试中预设的假设。你的模型是冻结的,但你的用户不是。两者之间的鸿沟是一种大多数团队根本没有监测到的“漂移”——它产生了一种 AI 工程中最令人困惑的故障模式:在没有部署的情况下指标发生衰减。
