你的推荐模型在三个月前上线了。点击率增长了 18%。观看时长在不断攀升。仪表盘上一片飘绿。领导层很满意。
而你的模型正在悄悄地破坏它将用于训练下一个版本的数据。
这就是训练数据自中毒(training data self-poisoning):一种反馈循环,其中已部署的 AI 功能会改变用户行为,其方式破坏了模型最初训练时学习的交互数据。最糟糕的是,你的标准参与度指标会告诉你一切正常 —— 直到它们失效的那一刻。
这种现象在物理学中有一个名字:海森堡问题(Heisenberg problem)。测量一个系统的行为本身就会改变该系统。在推荐和个性化领域,你的模型并不是在被动地观察用户喜欢什么 —— 它是在主动地决定他们能看到什么,这塑造了他们的点击行为,而这些行为又成为了下一个模型的训练信号。测量改变了被测量的对象。你永远无法观察到在没有模型干预的情况下,用户会做出什么样的选择。
循环是如何闭合的
一旦你看清了其中的机制,过程其实非常直观。模型在历史用户交互数据上进行训练。它被部署并开始呈现推荐。用户与被展示的内容进行交互 —— 因为他们只能与被展示的内容进行交互。这些交互数据被收集并反馈到重新训练中。下一个模型从一个反映了第一个模型选择的数据集中学习,而不是反映用户真实的偏好。
具体来看这意味着什么。你的模型向用户 A 推荐 "Taylor Swift",向用户 B 推荐 "爵士乐"。它从不给用户 A 展示任何爵士乐。用户 A 永远不会点击爵士乐。重新训练的数据集将此记录为用户 A 不喜欢爵士乐的证据。下一个模型对自己通过最初的推荐决策所制造出来的这种 “偏好” 变得更加自信。
这就是曝光偏差(exposure bias),它是使反馈循环难以逃脱的基础约束。模型只能看到它选择曝光的项目的反馈信号。从未展示过的项目积累的信号为零。因此,训练数据是所有可能的用户-项目交互的一个严重偏斜的样本 —— 恰恰偏向于前一个模型已经相信的东西。
这种动态通过流行度进一步复合。热门项目被展示得更多,积累了更多点击,从而训练模型更多地展示它们。新鲜或小众项目永远无法获得足够的曝光来积累信号。结果是产生了一种 “强者恒强” 的动态,在连续的重训周期中,训练分布会塌缩到内容库中越来越窄的一小部分。Glovo 的工程团队审计了他们的机器学习系统,发现他们 120 多个生产模型中有一半以上已经变得 “结果匮乏”(outcome starved)—— 几乎只在他们已经决定优化的结果上收集反馈,而没有人意识到这一切正在发生。
无声失败模式
这就是为什么团队无法及早发现这一点:参与度指标在结构上无法检测到它。
点击率衡量的是用户是否点击了模型展示给他们的内容。它们并不衡量这些内容是否真的是最佳选择,或者用户是否会对其他内容更满意。观看时长衡量的是用户是否观看了推荐的内容。它并不衡量用户是否探索了他们真正想要发现的东西。转化率衡量的是用户是否完成了交易。它们并不衡量这些交易代表的是真实的偏好,还是受限选择的结果。
当模型的反馈循环运行时,这些指标实际上可能会随着质量的下降而提升。YouTube 早期的算法优化原始点击量,催生了一个点击诱饵(clickbait)缩略图胜过高质量内容的系统 —— 这不是因为用户更喜欢点击诱饵,而是因为模型自身选择训练了它去制造这种偏好。点击量上升了,而内容多样性和长期用户满意度却被侵蚀了。
这一模式最显著的证据来自 2026 年初发表的一项医疗 AI 研究。在 AI 生成的医疗笔记上进行重训的模型,在标准评估指标上表现出明显的提升 —— 因为它们是在与训练它们时相同的污染分布数据上进行评估的。当在反馈循环之外的真实临床笔记上进行测试时,以困惑度(perplexity)衡量的理解能力下降了 45 倍。仪表盘显示模型正在变得更好。而模型在实际任务中的表现却在变差。
普遍规律是:你的离线评估指标是在你的模型所创建的相同偏斜数据集上计算的。它们会确认你的模型正在改进。离线与在线之间的差距(offline-online gap)—— 即离线指标的改进与现实世界 A/B 测试结果之间的背离 —— 通常是第一个可以衡量的信号,表明出了问题,而到那时,反馈循环已经运行了数月之久。
检测模式
几种预警信号可以在反馈回路污染演变成危机之前将其识别出来。
预测多样性坍塌。 监控模型输出分布随时间的熵(Entropy)。如果推荐结果变得越来越同质化——即模型对更少的一组物品表现出越来越高的置信度——那么反馈回路正在缩小其对世界的视野。随着时间的推移,多样性指标(如类目覆盖率、推荐分布的基尼系数)通常会在综合参与度指标下降之前显示出退化趋势。
长尾消失。 少数项、小众偏好和长尾内容应该以一定的比例出现在你的推荐日志中。当它们不再出现时,说明它们已经失去了反馈,在下一次训练运行中实际上是不可见的。如果你每周跟踪目录中获得推荐曝光的百分比,下降的曲线就是一个早期预警信号。
离线-在线评估不一致。 如果你的离线评估(基于历史数据)一致预测会有改进,但你的 A/B 测试结果却持平或为负,那么历史数据已经偏离了 Ground Truth。这通常是最清晰的信号,但它需要运行足够多的 A/B 测试才能察觉到这种模式。
位置偏差放大。 无论内容质量如何,排名较高的位置总是会获得更多点击——这就是位置偏差,它存在于所有排名系统中。如果你训练数据中的位置偏差正在增长而不是保持稳定,那么模型越来越多地在从其自身的排名决策中学习,而不是从真正的相关性信号中学习。你可以通过比较随机排名内容与模型排名内容在不同位置的点击率来衡量这一点。
从部署到发现的时间线通常比工程师预期的要长。Spotify 用户在问题被广泛公认之前,曾在长达两年的时间里反馈算法质量明显下降。YouTube 的团队花了大约五年时间(2007–2012 年)才得出结论:点击优化是错误的指标。在大多数情况下,发现往往发生在用户投诉升级、A/B 测试屡次无法显示改进,或者团队深入研究为什么在整体平均水平健康的情况下,某一细分用户的参与度却异常低时。
维护未受污染的 Ground Truth 唯一持久的解决方案是维护一个你的部署模型无法污染的反馈信号源。
随机预留组(Random holdout groups) 是金标准。留出一部分随机抽样的用户——通常是 5–10%——他们永远不会收到来自你生产模型的推荐。这些用户与基准系统或兜底系统提供的内容进行交互。他们的交互数据为你提供了一个不反映模型选择的无偏用户偏好样本。当你重新训练或评估模型时,你可以检查预留组的行为是否仍然符合模型的预测。发散程度直接衡量了反馈回路对训练分布的扭曲程度。
代价是真实存在的:你牺牲了一定比例的用户流量,可能会降低短期参与度。好处是你保持了观察的完整性,使得你的评估系统值得信赖。一家维持 5% 预留组的在线杂货服务发现,只有 12% 的推荐驱动购买是真正的增量购买——其余的无论如何都会发生。如果没有预留组,他们的模型就会将那些并非由它引起的行为归功于自己。
探索预算(Exploration budgets) 起到类似的作用。刻意向用户展示随机选择的物品——即使比例很小——也能为模型永远不会选择推荐的物品生成无偏信号。这些数据对于评估你的倾向得分校正计算是否有效,以及训练不完全依赖于先前模型选择决策的未来模型至关重要。
反事实评估(Counterfactual evaluation) 即使在你没有干净的预留组时,也能为离线指标提供纠正视角。逆倾向得分加权(IPS)通过模型展示该物品概率的倒数来重新加权观察到的交互——有效地纠正了日志中的选择偏差。自归一化 IPS 降低了原始 IPS 估计的方差,使其在生产环境中更具实用性。双重稳健估计(Doubly Robust estimation)将 IPS 与奖励预测模型相结合,只要其中任何一个组件定义得当,就能为你提供一个无偏估计器。
这些技术需要知道倾向性(Propensity)——即部署模型选择展示每个物品的概率——这意味着需要在推理时记录模型的推荐概率,而不仅仅是最终的推荐结果。如果你现在没有记录倾向性,那么你进行反事实纠正的选择将非常有限。这是那些在部署前做决定成本很低,但在部署后重建却非常昂贵的生产工程决策之一。
组织性失效模式 大多数经历过训练数据自我投毒的团队并没有做出任何一个错误的决定。他们只是做了一系列合理的决策:部署模型、收集反馈、根据反馈重新训练、循环往复。反馈循环的污染是逐渐积累的,隐藏在衡量错误目标的指标背后。
让这种模式最危险的地方在于围绕重新训练的激励结构。当新版本的模型显示指标提升时,团队会庆祝。重新训练流水线是自动化且可靠的。离线评估持续显示进展。没有任何天然的强制机制能让你停下来问一句:训练数据本身是否已经偏离了事实真相 (ground truth)。
将留存组 (holdout groups) 和探索 (exploration) 视为可选的工程工作——即等核心系统稳定后再添加的内容——恰恰是导致发现过晚的决定。当离线和在线指标开始出现分歧时,受污染的训练分布已经积累了数月之久。清理工作不仅需要一个新的模型,通常还需要一套新的数据收集策略,这意味着反馈循环的时钟必须从零开始。
那些能够及早发现这一问题的团队,已经将这种质疑精神工具化了。他们在追踪 CTR 的同时也会追踪目录覆盖率指标。他们运行定期的离线-在线对比测试,专门用于检测差距。他们不把探索视为一种效率成本,而是将其视为保持事实真相真实性的机制。他们像科学家维护对照组一样维护留存组——不是因为他们期望立即使用这些数据,而是因为移除对照组会使实验失效。
你的模型当前正在做出的决策,将成为明天的训练数据。这究竟是创造一个良性循环还是一个退化性循环,取决于你是否构建了足以识别两者差异的测量基础设施。
会员专享
余下内容仅对会员开放。 会员可读完整内容 —— 每一个公开发布的观点背后,那些框架、决策与推理的全貌。
— 完整文章,包含未公开存档的部分 — 可落地的工作框架,附带权衡与决策依据 — 新文章抢先看,先于公开发布 登录以继续阅读→ 随时取消 · 一次订阅,畅读全部