·tian
被两个漂移向量拉扯的评估准则
一个同时由人类和 LLM 裁判阅读的评估准则会在两个轴向上同时发生漂移。综合得分掩盖了这种波动。本文介绍了一种测量协议,使每种漂移都变得可追溯。
insider
evals
llm-judge
measurement
+2·tian
先收敛、后悄然崩溃的评估
停滞不前的评估分数并不总是意味着模型达到了天花板。当标注者趋于同质化时,一致性指标会上升,而评估则不再能衡量团队认为它正在衡量的内容。
evals
llm-judge
labeling
ai-engineering
+1·tian
评估员吞吐量是评估流水线中隐藏的瓶颈
在任何重视人工评分的 AI 系统中,评估员的吞吐量都限制了评估速度。本文介绍了一套运营规范——包括校准周期、感知队列的优先级排序以及评分标准反馈循环——旨在将标注产能视为一个 SRE 问题,而非招聘问题。
insider
evals
ai-engineering
operations
+1