模型崩溃始于你自己的数据湖
每个人都在担心模型崩溃,将其视为一个互联网规模的问题:AI 废话充斥网络,下一代基础模型基于这些数据进行训练,导致质量在一个缓慢的文明反馈循环中衰退。这种表述让人感到宽慰,因为它把崩溃变成了别人的问题——这是发生在 OpenAI 和 Anthropic 身上、以年为单位的事情,并且由成群的数据清洗博士负责缓解。
这里有一个令人不安的版本:同样的反馈循环已经在你公司内部运行,而且它的收敛速度比互联网规模的循环快得多。每一个被标记为“黄金示例”的日志补全、每一个进入 RAG 语料库的模型编写文档、每一个通过 LLM 生成答案并由 LLM 评判的评估——每一项都是在利用你自己的“数据废气”进行训练的微小行为。你不需要九代的递归预训练就能感受到它。在一个从自身日志中挖掘少样本示例和微调数据的生产系统中,第二代产品下个季度就会发布。
