模型崩溃始于你自己的数据湖
每个人都在担心模型崩溃,将其视为一个互联网规模的问题:AI 废话充斥网络,下一代基础模型基于这些数据进行训练,导致质量在一个缓慢的文明反馈循环中衰退。这种表述让人感到宽慰,因为它把崩溃变成了别人的问题——这是发生在 OpenAI 和 Anthropic 身上、以年为单位的事情,并且由成群的数据清洗博士负责缓解。
这里有一个令人不安的版本:同样的反馈循环已经在你公司内部运行,而且它的收敛速度比互联网规模的循环快得多。每一个被标记为“黄金示例”的日志补全、每一个进入 RAG 语料库的模型编写文档、每一个通过 LLM 生成答案并由 LLM 评判的评估——每一项都是在利用你自己的“数据废气”进行训练的微小行为。你不需要九代的递归预训练就能感受到它。在一个从自身日志中挖掘少样本示例和微调数据的生产系统中,第二代产品下个季度就会发布。
对此的原始研究非常严峻。Shumailov 等人 2024 年发表在《自然》杂志上的论文显示,在递归生成的数据上进行无差别训练的模型会遭受不可逆的缺陷:原始分布的尾部首先消失,然后输出会趋向于重复的、低方差的平庸内容。他们著名的演示始于关于中世纪建筑的文本,并在九代之后以一串野兔列表告终。但实验室的设置——每一代都完全替换训练数据——并不是该发现与你相关的关键。关键在于其机制,而该机制并不在乎循环是运行在公共互联网还是你的数据湖中。
你刻意构建的飞轮
没有人会为了在自己的输出上进行训练而出发。团队的目标是构建一个数据飞轮:记录每一次交互,收集优质的交互,并将它们反馈回来以改善产品。供应商的架构图将此展示为一种明确的优点——使用产生数据,数据改进模型,更好的模型驱动更多使用。
问题在于,“优质的交互”越来越多地由模型创作。追踪一下这些回收数据究竟来自哪里:
- 从日志中挖掘的少样本示例。 提示词工程师在生产日志中搜索高评分的补全结果,并将最好的结果粘贴到系统提示词中。模型现在正在模仿自己,并筛选出了那些讨喜的结果。
- 基于接受的输出进行微调。 经典的飞轮:用户点击了“接受”,于是补全结果就成了一对训练数据。但“接受”大多意味着“还不够讨厌,不足以拒绝”——这是一个比“正确”弱得多的信号,且偏向于模型现有的风格。
- 吞食 Agent 输出的 RAG 语料库。 你的 Agent 编写工单、摘要、运行手册和 Wiki 页面。这些文档被索引。下周,模型会检索自己的摘要作为权威上下文,并再次对其进行摘要,形成一个又一个的有损压缩。
- LLM 评判 LLM 候选。 当同一家族的模型生成答案并进行评分时,你构建的是偏好放大,而不是评估。最近关于 LLM 驱动反馈循环的研究显示,系统正从学习人类偏好转向强化模型诱导的偏好。
孤立地看,每一步似乎都是合理的。但复利效应才是致命的:一次补全变成了一篇文档,文档变成了检索上下文,检索到的答案得到了好评,好评将其推入微调集。四步跳转,其中没有一步被标记为“合成”。
崩溃以自信而非乱码的形式到来
野兔的例子让崩溃听起来很容易察觉。但事实并非如此。2025 年一项关于递归合成训练的研究发现了一种被称为知识崩溃(knowledge collapse)的现象:事实准确性下降,而表面流畅度却持续存在甚至有所提高。模型并不会退化成词语堆砌——它会变得更加圆滑,同时变得更加自信地胡说八道,因为流畅性正是自我训练所强化的属性,而事实依据正是它所侵蚀的属性。
这种失效模式在标准监控下几乎是不可见的。你的困惑度(Perplexity)看起来很正常。你的风格契合度提高了——当然,因为模型是根据自己的散文进行评分的。格式合规性评估显示为绿色。与此同时,三个较为隐蔽的方面正在恶化:
- 尾部知识首当其冲。 统计抽样误差意味着稀有事件——不寻常的客户配置、边缘情况的错误代码、每月被问及一次的问题——会比其他任何内容更早地从回收分布中脱落。而这些恰恰是你最需要模型的情况。
- 多样性变窄。 输出趋向于模型的众数表述和众数推理路径。在你的指标发现问题之前,用户就会察觉到这种千篇一律。
- 错误硬化为事实。 一个虚构的参数名,被写入运行手册,作为上下文被检索,并在另外五个文档中被重述,就不再是幻觉了。它是语料库的共识。你那缺乏来源追溯的数据湖无法告诉你哪个才是源头。
宏观数据表明环境污染也在上升:Ahrefs 对 90 万个新创建网页的分析发现,大约四分之三包含至少部分 AI 生成的内容,追踪研究显示,自 2024 年底以来,AI 辅助文章在数量上已与纯人工撰写的文章持平。无论你从网上抓取、授权还是粘贴什么,它都已经部分是合成的了。你的内部循环就叠加在这个基线之上。
真正有帮助的研究细节
如果故事以“递归会摧毁一切”告终,那么唯一的建议只能是绝望。但事实并非如此。随后的文献提出了一个应当直接影响你管线设计的区分:最关键的是合成数据是替换了真实数据,还是与之共同累积。
Gerstgrasser 等人表明,当每一代模型都在累积池(原始人类数据加上所有合成的代际数据)上进行训练时,无论运行多少次迭代,测试误差都会保持在可控范围内。严格意义上的“崩溃”需要一种“替换机制”,即新的模型输出挤掉了原始分布。随后的统计研究(《崩溃还是繁荣?》)进一步完善了这一点:结果取决于真实数据与合成数据的比例,以及是否有人在合成数据重新进入训练前 对其进行了验证。2025 年一系列关于合成数据验证的研究表明,即使是不完美的验证器(只能过滤掉部分垃圾信息的过滤器),也能显著延迟或防止退化。
将这些论文黑话转化为具体的管线建议,结论非常明确:
- 绝不要让回收的输出取代你的人类编写锚点集。 保持原始语料库不可变,并始终参与训练。删除并替换是导致崩溃的机制;累积则是安全的机制。
- 比例是一个你必须实际监测的旋钮。 如果你无法说明当前微调集中有多少比例是模型生成的,那么老实的回答只能是“比上季度多,而且还在增加”。
- 验证会改变机制。 人类审核、代码执行检查,甚至是在生成和重新摄入之间加一个较弱的独立过滤器,都能为你提供不成比例的保护。论文中提到的病态案例,指的都是那种无过滤的自动飞轮。
这些缓解措施并不罕见。但它们都要求具备一种大多数数据湖完全缺乏的能力:识别哪些字节来自模型。
溯源是关键所在
这里有一个令人不安的审计问题:对于 RAG 索引中的随机文档或训练仓库中的随机行,你能说出它是否由模型编写吗?对于大多数团队来说,答案是否定的——不是因为这些信息难以保存,而是因为没人去保存。当 LLM 的输出被粘贴到工单、合并进维基或写入仓库表的那一刻,它的来源就消失了。
文本领域不存在“低本底钢”;你无法在受到污染后重建预污染的纯净度。溯源只有在写入时才是廉价的。
行之有效的规范 看起来像是应用于生成的谱系跟踪(Lineage Tracking),它分为三个层级:
- 在源头打标签,而不是在摄入时。 每个模型生成的产物在创建瞬间就会获得溯源元数据:哪个模型、哪个提示词版本、经过了什么样的人类审核。你的推理网关(Inference Gateway)是天然的关卡——它已经看到了每一次补全,所以让它为每一次补全盖戳。下游打标签是考古;源头打标签是记账。
- 随转换过程传递标签。 合成文档的摘要依然是合成的。人类对模型草稿的编辑是混合的——而“混合”值得作为独立类别进行跟踪,因为对新网页内容的研究发现,重度人工编辑的 AI 文本是主流类别,而非纯模型生成。如果你的谱系工具(就像你用于处理 GDPR 数据主体请求的那种)能回答“哪些表源自此源头”,它就能回答“哪些行源自模型”。
- 重新进入前的隔离。 合成和混合内容默认进入暂存区,在通过显式关卡(人类验证、针对真值的执行验证,或至少是一个非同族模型生成的独立过滤器)之前,被排除在训练集查询和 RAG 索引之外。关键属性是:重新进入训练供应源是一个人为的决策,而不是存储带来的副作用。
然后,验证循环是否真的按照崩溃实际表现出的方式被打破了:保留一组长尾案例的评估集——冷门意图、低频实体、你的支持团队每月(而非每小时)才会遇到的问题——将这些在飞轮转动前的数据冻结起来,专门观察它们。综合基准测试在知识崩溃很久之后可能依然显示“绿色”;而长尾评估才是最初真实信号出现的地方。
将模型输出视为未标记的同位素
做得好的团队拥有共同的态度,而非共同的工具:他们将模型生成的文本视为一种非常有用、但绝不能在未加标签的情况下进入“食物链”的材料。合成数据不是毒药——累积实验的结果清楚地表明了这一点,而且经过深思熟虑、验证过的合成数据是过去两年中一些最佳后训练效果的功臣。未标记的合成数据才是毒药,因为它剥夺了你选择所处机制的能力。有了溯源,你是在运行受控的数据增强;没有它,你就是在自己的产品上运行 Shumailov 实验,处于替换机制中,且每季度都在迭代。
实际的起点只需要一个下午的工作:让你的推理网关为每个补全盖上溯源元数据的戳,并在你的摄入模式中添加一个 synthetic 标志,默认值为“未知,已隔离”。除此之外的一切——传递规则、比例仪表盘、长尾评估——都构建在这两个比特位之上。
跳过这一步的团队将在 2027 年试图拨乱反正,在他们的数据湖中挖掘模型出现前的地层,就像材料科学家曾经从二战前的沉船中打捞废钢以寻找未受污染的钢材一样。而那些现在就开始打标签的人,永远不必经历这些。
- https://www.nature.com/articles/s41586-024-07566-y
- https://arxiv.org/abs/2404.01413
- https://arxiv.org/abs/2509.04796
- https://arxiv.org/abs/2410.16713
- https://arxiv.org/abs/2412.14689
- https://arxiv.org/abs/2510.16657
- https://arxiv.org/abs/2504.03814
- https://ahrefs.com/blog/what-percentage-of-new-content-is-ai-generated/
- https://www.axios.com/2025/10/14/ai-generated-writing-humans
- https://www.nvidia.com/en-us/glossary/data-flywheel/
