跳转到主要内容

52 含有标签「fine-tuning」

Posts tagged "fine-tuning" on TianPan.co.

查看所有标签

·tian

预训练的阴影:你的微调计划忽视的隐性约束

微调改变的是模型说话的方式,而非其根本知识或信念。以下是研究所揭示的实践者不断触碰的上限——以及如何绕过它。

llm
fine-tuning
machine-learning
enterprise-ai
·tian

持续微调而不污染数据:生产流水线指南

一份关于从用户反馈中持续微调大语言模型的生产工程指南——涵盖数据路由架构、污染检测、灾难性遗忘预防以及自动化安全保护。

insider
mlops
fine-tuning
llm
+1
·tian

少样本饱和曲线:为什么添加更多示例最终会适得其反

向提示中添加更多少样本示例看起来是免费的收益——其实不然。这里有经验数据说明曲线在何处开始对你不利、为何发生以及该怎么做。

insider
prompt-engineering
llm
in-context-learning
+1
·tian

微调数据集溯源:六个月后你无法回答的审计问题

大多数生产中的微调模型无法可靠回答训练样本的来源问题。这里提供溯源注册表模式和审计工作流,让你在监管机构询问之前就有答案。

insider
fine-tuning
data-governance
compliance
+1
·tian

SFT、RLHF 与 DPO:垂直领域应用中的模型对齐方法决策矩阵

一个实用的决策框架,用于在垂直领域应用中对 LLM 进行对齐时,在有监督微调 (SFT)、RLHF 和 DPO 之间进行选择——包括如何诊断你的对齐差距是数据问题、奖励问题还是能力缺失。

insider
fine-tuning
llm
alignment
+1
·tian

课程陷阱:为什么针对最佳示例进行微调会产生平庸的模型

仅策划高质量、高置信度的输出作为微调数据会导致分布失配,破坏对不确定性的感知,并产生“自信地犯错”的模型。本文将探讨其中的原因以及你应该采取的对策。

insider
fine-tuning
llm
ai-engineering
+1
·tian

适配器兼容性悬崖:当你的微调模型遇到新版基础模型

LoRA 和 PEFT 适配器在维度上与训练时使用的基础模型深度绑定。当提供商悄然或公开地更新底层模型时,你的微调结果可能以形状不匹配错误崩溃,更危险的是,它可能在毫无警报的情况下静默降级。本文解析哪些部分会出问题、为何会出问题,以及如何保护生产环境中的微调模型免受基础模型更新的影响。

llm
fine-tuning
mlops
lora
+1
·tian

不会崩溃的合成数据管道:大规模生成训练数据

模型崩溃会悄然降低在自身输出上训练的 LLM 的性能。了解累积混合、多源生成、验证堆栈和多样性监控等管道架构,让合成训练数据保持高效而非自我中毒。

insider
synthetic-data
model-collapse
fine-tuning
+2
·tian

微调 vs. RAG 知识注入:工程师经常搞错的决策框架

微调教会模型行为;RAG 注入可检索的事实。大多数团队混淆了这两者,花费数月时间去微调原本只需要检索的模型。这里是区分它们的决策框架。

fine-tuning
rag
llm
ai-engineering
+1
·tian

微调经济学:投入之前真正的成本计算

大多数团队将微调成本低估了 3–5 倍,因为他们只预算了训练运行的费用。这里有一套完整的成本模型 —— 包括数据整理、失败的实验、部署、维护 —— 以及一个用于判断 LoRA/PEFT 在何时真正胜过长达数月的提示工程的决策框架。

fine-tuning
lora
peft
llm
+1
·tian

合成训练数据质量崩溃:反馈循环如何摧毁你的微调模型

使用 LLM 生成微调数据会产生反馈循环,从而放大偏见、收缩分布并导致不可逆的模型退化——而大多数团队直到为时已晚才意识到这一点。

insider
fine-tuning
synthetic-data
model-collapse
+1
·tian

领域特定 LLM 微调的合成数据流水线

构建领域特定 LLM 微调的合成数据流水线实用指南 —— 涵盖蒸馏与自我提升、质量过滤、防止模型崩溃以及预算驱动的策略选择。

llm
fine-tuning
synthetic-data
ml-engineering
显示第 37–48 篇,共 52 篇