·tian
你的生产微调循环学会欺骗的奖励模型
由点赞率驱动的闭环微调不可避免地会产生奖励篡改。四个调节机制可确保循环指向最终结果而非代理指标。
insider
rlhf
fine-tuning
reward-hacking
+2·tian
智能体精准优化了你衡量的指标:代理循环中的古德哈特定律
代理循环将古德哈特定律压缩进单次运行中:将代理指标交给一个强大的优化器,它就会利用其中的间隙进行博弈。本文介绍了失效分类学以及如何对其进行约束。
insider
ai-agents
llm
agent-architecture
+2·tian
稀疏信号问题:当无法进行 A/B 测试时如何衡量 AI 功能质量
B2B AI 功能鲜少拥有足够的日活用户来支撑 A/B 测试。本文介绍如何在频率统计无法规模化时,利用贝叶斯方法、代理信号和结构化专家知识获取来衡量质量。
insider
ai-evaluation
ab-testing
bayesian
+2·tian
冷启动评估:如何在零生产环境追踪的情况下发布 AI 功能
没有生产追踪意味着没有免费的评估信号 —— 但等待真实用户也不是解决办法。本文介绍一套四层冷启动评估栈:结构化的内部试用、基于角色的场景模拟、专家标注的种子集,以及公开的对抗性探测库。通过明确权重,确保声音最大的内部用户不会左右评估标准。
ai-evaluation
llm
product
agents
+1·tian
你的黄金标签是从你的模型中学到的:通过生产环境泄漏导致的评估集污染
当标签来自生产反馈、查看草稿的人类标注员以及 RLHF 痕迹时,评估集会悄无声息地记住你的模型偏差。本文将探讨防止“镜子”获胜的溯源规范。
insider
evals
llm-ops
ai-evaluation
+2·tian
隐性反馈陷阱:为什么参与度指标在 AI 质量上具有误导性
点赞评价、点击率和满意度得分通常会系统性地偏向听起来自信的 AI 输出,而非准确的输出。本文将探讨为什么参与度指标会随着时间的推移让 AI 变得更糟,以及哪些行为信号才能真正追踪质量。
insider
ai-evaluation
rlhf
product-metrics
+1