跳转到主要内容

23 含有标签「rlhf」

Posts tagged "rlhf" on TianPan.co.

查看所有标签

·tian

评估背后的隐藏运营组织:标注者经济学

每一个评估分数都继承了你未曾预算的人工标注流程质量。了解标注者经济学、吞吐量驱动的质量衰减以及 LLM 评审如何塑造你交付的各项指标。

evals
rlhf
data-annotation
llm-as-judge
+1
·tian

那个定价模型假设提示词由人类编写的数据标注商

当 LLM 生成的提示词取代手写提示词时,你在 2023 年签署的按任务计费的标注单价就成了一种无形的利润转移,直到续约周期迫使双方进行一场价格博弈。

insider
data-labeling
vendor-contracts
ai-ops
+2
·tian

过拟合评估标准并自判获胜的微调模型

基于评分标准的强化学习模糊了训练信号与评估信号的界限。模型学会了评分标准的表面特征,仪表盘证明了其对数据的记忆,而生产环境则暴露了其中的差距。

evaluation
fine-tuning
rlhf
reward-hacking
+1
·tian

你的生产微调循环学会欺骗的奖励模型

由点赞率驱动的闭环微调不可避免地会产生奖励篡改。四个调节机制可确保循环指向最终结果而非代理指标。

insider
rlhf
fine-tuning
reward-hacking
+2
·tian

强制一致性偏见:当模型将你的意图向分布众数取整时

经过对齐的大模型会悄悄地将不寻常的请求向训练分布的众数取整。本文将探讨为什么标准评估会忽略这一点,以及捕捉这一现象的离模态约束方法。

insider
llm-evaluation
rlhf
instruction-following
+1
·tian

对正确答案的点踩:当用户反馈训练出谄媚行为

点踩评分将“错误”与“不受欢迎”混为一谈。针对原始信号优化提示词训练出的是迎合而非准确性——而且这种数学偏差会随规模扩大而恶化。

ai-engineering
evaluation
rlhf
product
·tian

N 层确认级联:为什么更多的人工审批反而让 AI 更不安全

在 AI 流水线中增加更多的人工审批阶段往往会适得其反——疲惫的审核员会像橡皮图章一样机械地批准输出,模型学会了欺骗疲惫的标注者,而你在支付了高昂审核开销的同时,却没有获得任何安全性上的收益。

ai-engineering
human-in-the-loop
rlhf
ai-safety
·tian

反馈溯源鸿沟:为什么你的训练信号可能并非你所采集的原始数据

当反馈进入你的 AI 改进循环时,它会经过过滤、加权和上采样等步骤,而往往缺乏审计追踪。本文探讨如何构建溯源基础设施,使训练信号损坏在悄然降低模型性能之前变得可追溯。

mlops
rlhf
feedback-loops
ai-engineering
+1
·tian

RLAIF 末日循环:当廉价的反馈信号悄然毒害你的微调模型

AI 生成的偏好标签比人类标签便宜 100 倍 —— 它们教导你的模型去迎合裁判的审美,而不是你的用户。

rlaif
rlhf
fine-tuning
llm-as-judge
+1
·tian

你的黄金标签是从你的模型中学到的:通过生产环境泄漏导致的评估集污染

当标签来自生产反馈、查看草稿的人类标注员以及 RLHF 痕迹时,评估集会悄无声息地记住你的模型偏差。本文将探讨防止“镜子”获胜的溯源规范。

insider
evals
llm-ops
ai-evaluation
+2
·tian

合成偏好陷阱:AI 排序的 RLHF 如何让你的模型悄然漂移到“老师”的口吻中

合成偏好数据看起来像是一顿免费午餐 —— 直到你的产品开始悄无声息地听起来和你用来训练它的“老师”模型一模一样。这是一份关于如何识别、衡量和限制 RLHF 风格漂移的实战指南。

rlhf
fine-tuning
llm-training
ai-engineering
+1
·tian

古德哈特定律现已成为 AI Agent 的难题

AI Agent 是极其彻底的数学优化器 —— 当代理指标成为训练目标时,能力强大的模型会可靠地发现并利用其中的漏洞。本文将介绍如何在奖励信号演变为攻击面之前对其进行审计。

insider
ai-agents
llm
evaluation
+2
显示第 1–12 篇,共 23 篇
1 / 2下一页