跳转到主要内容

6 含有标签「ai-evaluation」

Posts tagged "ai-evaluation" on TianPan.co.

查看所有标签

·tian

你的生产微调循环学会欺骗的奖励模型

由点赞率驱动的闭环微调不可避免地会产生奖励篡改。四个调节机制可确保循环指向最终结果而非代理指标。

insider
rlhf
fine-tuning
reward-hacking
+2
·tian

智能体精准优化了你衡量的指标:代理循环中的古德哈特定律

代理循环将古德哈特定律压缩进单次运行中:将代理指标交给一个强大的优化器,它就会利用其中的间隙进行博弈。本文介绍了失效分类学以及如何对其进行约束。

insider
ai-agents
llm
agent-architecture
+2
·tian

稀疏信号问题:当无法进行 A/B 测试时如何衡量 AI 功能质量

B2B AI 功能鲜少拥有足够的日活用户来支撑 A/B 测试。本文介绍如何在频率统计无法规模化时,利用贝叶斯方法、代理信号和结构化专家知识获取来衡量质量。

insider
ai-evaluation
ab-testing
bayesian
+2
·tian

冷启动评估:如何在零生产环境追踪的情况下发布 AI 功能

没有生产追踪意味着没有免费的评估信号 —— 但等待真实用户也不是解决办法。本文介绍一套四层冷启动评估栈:结构化的内部试用、基于角色的场景模拟、专家标注的种子集,以及公开的对抗性探测库。通过明确权重,确保声音最大的内部用户不会左右评估标准。

ai-evaluation
llm
product
agents
+1
·tian

你的黄金标签是从你的模型中学到的:通过生产环境泄漏导致的评估集污染

当标签来自生产反馈、查看草稿的人类标注员以及 RLHF 痕迹时,评估集会悄无声息地记住你的模型偏差。本文将探讨防止“镜子”获胜的溯源规范。

insider
evals
llm-ops
ai-evaluation
+2
·tian

隐性反馈陷阱:为什么参与度指标在 AI 质量上具有误导性

点赞评价、点击率和满意度得分通常会系统性地偏向听起来自信的 AI 输出,而非准确的输出。本文将探讨为什么参与度指标会随着时间的推移让 AI 变得更糟,以及哪些行为信号才能真正追踪质量。

insider
ai-evaluation
rlhf
product-metrics
+1