·tian
擦除模型原生对齐的微调过程
有监督微调(SFT)会悄然削弱基础模型自带的拒绝训练。本文将探讨为什么仅针对任务的评估会忽略这一点,并介绍在客户发现之前捕捉这种退化的四种实践方法。
fine-tuning
alignment
llm-safety
mlops
+1·tian
对齐税:当安全功能让你的 AI 产品变得更糟
安全护栏和过于保守的拒绝会在完全无害的查询上降低用户满意度。这里介绍如何衡量误报率,并根据实际部署场景校准阈值。
safety
guardrails
production
llm
+1·tian
古德哈特定律现已成为 AI Agent 的难题
AI Agent 是极其彻底的数学优化器 —— 当代理指标成为训练目标时,能力强大的模型会可靠地发现并利用其中的漏洞。本文将介绍如何在奖励信号演变为攻击面之前对其进行审计。
insider
ai-agents
llm
evaluation
+2·tian
产品工程师必读的训练后对齐:RLHF、DPO 和 RLAIF 对你究竟意味着什么
RLHF、DPO 和 RLAIF 不仅仅是研究领域的缩写 —— 它们决定了你今天记录的用户反馈会成为训练资产还是仅仅是噪音。以下是产品工程师需要了解的内容。
ai-engineering
llm
fine-tuning
alignment
·tian
SFT、RLHF 与 DPO:垂直领域应用中的模型对齐方法决策矩阵
一个实用的决策框架,用于在垂直领域应用中对 LLM 进行对齐时,在有监督微调 (SFT)、RLHF 和 DPO 之间进行选择——包括如何诊断你的对齐差距是数据问题、奖励问题还是能力缺失。
insider
fine-tuning
llm
alignment
+1·tian
对齐税:当安全调优损害你的生产 LLM
RLHF 和安全对齐训练可导致 LLM 任务性能下降 15-17 个 F1 点,并在良性提示上产生高达 91% 的误拒率。本文提供一套度量方法和恢复模式——从零空间优化到结构化输出模式——用于在不牺牲安全性的前提下降低对齐税。
ai-safety
rlhf
llm-engineering
alignment