跳转到主要内容

7 含有标签「synthetic-data」

Posts tagged "synthetic-data" on TianPan.co.

查看所有标签

·tian

输入分布与用户实际输入不匹配的合成训练样本

你的合成微调在离线评估中表现惊人,但在生产环境中却下降了 20 分。这是因为教师模型生成的输入形态更接近它接收到的提示词,而不是你用户发送的实际输入。

synthetic-data
fine-tuning
evaluation
llm-ops
·tian

你的合成训练数据正在向均值坍缩

为填补数据集空白而生成的合成数据正悄然向均值收缩,抹去了你所需要的稀有案例。本文将探讨为什么逐例质量检查会忽略这一问题,如何衡量集合层面的多样性,以及如何将生成过程锚定在真实数据上。

synthetic-data
model-collapse
llm-training
data-quality
+1
·tian

当 LLM 为自己批改作业:打破 AI 评估中的反馈循环

LLM 生成的评估集创建了一个反馈循环,导致模型偏见被编码为事实标准 (Ground Truth)。以下是打破该循环的污染信号、跨模型验证策略以及人工采样规范。

insider
llm-evaluation
synthetic-data
ai-engineering
+1
·tian

合成种子数据:在首批千名用户到来之前启动微调

AI个性化和任务专项微调在没有行为数据时会遭遇冷启动困境。了解如何生成500–1,000个高质量合成样本,以及可能悄然毒化模型的失败模式。

insider
fine-tuning
synthetic-data
llm
+2
·tian

不会崩溃的合成数据管道:大规模生成训练数据

模型崩溃会悄然降低在自身输出上训练的 LLM 的性能。了解累积混合、多源生成、验证堆栈和多样性监控等管道架构,让合成训练数据保持高效而非自我中毒。

insider
synthetic-data
model-collapse
fine-tuning
+2
·tian

合成训练数据质量崩溃:反馈循环如何摧毁你的微调模型

使用 LLM 生成微调数据会产生反馈循环,从而放大偏见、收缩分布并导致不可逆的模型退化——而大多数团队直到为时已晚才意识到这一点。

insider
fine-tuning
synthetic-data
model-collapse
+1
·tian

领域特定 LLM 微调的合成数据流水线

构建领域特定 LLM 微调的合成数据流水线实用指南 —— 涵盖蒸馏与自我提升、质量过滤、防止模型崩溃以及预算驱动的策略选择。

llm
fine-tuning
synthetic-data
ml-engineering