·tian
你的合成训练数据正在向均值坍缩
为填补数据集空白而生成的合成数据正悄然向均值收缩,抹去了你所需要的稀有案例。本文将探讨为什么逐例质量检查会忽略这一问题,如何衡量集合层面的多样性,以及如何将生成过程锚定在真实数据上。
synthetic-data
model-collapse
llm-training
data-quality
+1·tian
AI 代码反馈循环:今日生成的代码如何训练明日的模型
随着AI生成的代码涌入生产代码库,它正在成为下一代模型的训练数据。这一反馈循环已经可以量化——而其失效模式足够隐蔽,以至于可能在不被察觉的情况下悄然到来。
ai-engineering
llm
code-quality
training-data
+1·tian
不会崩溃的合成数据管道:大规模生成训练数据
模型崩溃会悄然降低在自身输出上训练的 LLM 的性能。了解累积混合、多源生成、验证堆栈和多样性监控等管道架构,让合成训练数据保持高效而非自我中毒。
insider
synthetic-data
model-collapse
fine-tuning
+2·tian
合成训练数据质量崩溃:反馈循环如何摧毁你的微调模型
使用 LLM 生成微调数据会产生反馈循环,从而放大偏见、收缩分布并导致不可逆的模型退化——而大多数团队直到为时已晚才意识到这一点。
insider
fine-tuning
synthetic-data
model-collapse
+1