你的评估流水线每周会产生 800 条 trace 供人工审核。你的标注人员每周大约有 90 分钟的预算来处理这些数据。他们打开队列,对前三条进行打分,再将其余几条标记为“跳过”,然后就关闭了标签页。你在周一早上盯着看的排行榜,现在只是反映了哪些 trace 碰巧排在了列表顶部,而不是对系统质量的真实衡量。
这不是一个标注问题。这是一个披着质量问题外衣的吞吐量问题,也是评估项目退化最隐蔽的方式之一。Trace 仍在流动。仪表板仍在渲染。数值仍在变动。你没看到的是,你的“人工评分评估得分”的分母已经悄然缩减到了寥寥几项,而这些项是由一个没人刻意设计的排序函数挑选出来的。
任何曾负责过超出可持续负荷的 on-call 轮值的人,对这种模式都不会感到陌生。传呼机不断鸣响。工程师们不断点击确认。只有那些碰巧发生在风平浪静的工作日上班时间的事件,才会得到真正的复盘(postmortem)。其他所有事件都只得到一行简短的备注和一个绿色的复选框。从团队拥有的每一项指标来看,系统都很健康。而指标本身就是失败所在。
标注人员的吞吐量是瓶颈,且不会随流量增长而扩展
首先要内化的一点是,人工评分能力是一个硬性的、增长缓慢的上限。一个受过训练的审核员每小时可以仔细评分 30 到 100 条 trace,具体取决于任务的复杂程度以及他们在案例之间需要重新加载多少上下文。一个由三名审核员组成的兼职团队,每人每周投入 4 小时,每周最多只能完成约 1200 次仔细的评分。一个严肃的评估流水线在一个下午就能产生这么多 trace。
这种不对称性并不是一个可以通过再发一份招聘启事来解决的招聘问题。领域专家标注员正是那些日程表已经饱和的人,因为他们正是产品赖以生存的判断力的来源——工程师、律师、临床医生和支持主管。当问题在于某个特定的工具调用在特定客户的账户中是否是正确的操作时,聘请普通的标注员是没有任何帮助的。
因此,预算是固定的。相比之下,生产流量是呈指数级增长的。一旦你的应用每天的请求量突破几千次,产生的 trace 与人类实际阅读的 trace 之间的差距就会超过三个数量级。从那时起,每增加一个单位的流量,差距就会拉大。增加更多的审核员只能带来常数级的提升。评估流水线持续呈几何倍数增长。随着产品的成功,这个比例只会变得更糟,而不是更好。
队列顺序是没人选择的无声采样器
当产生的 trace 远多于人类能评分的数量时,你产生的 trace 与你评分的 trace 之间的差集就变成了一个样本。每个样本都有一个采样函数。如果你没有设计一个,默认值就是你的队列恰好使用的任何排序方式:时间戳、插入顺序、trace ID 哈希,或者是仪表板查询恰好命中的某个连接键(join key)。
这种默认排序几乎永远不是正确的答案,而且它很少是随机的。近期偏见(Recency bias)意味着最近的 trace 会占据主导。审核员在处理过程中会感到疲劳,导致队列末端的评分系统性不足。如果你的队列是按任何与输入相关的因素(用户 ID、请求大小、延迟)排序的,那么你的“人工评分得分”衡量的只是该排序方式呈现出的切片,而该排序方式隐藏的切片则是不可见的。
危险之处在于,这看起来像是一个信号。数值之所以每周保持稳定,是因为采样偏见是稳定的。因为它具有一致性,所以感觉像是一个真实的衡量。当系统改变时,数值会变动,因为某些变化确实出现在了被评分的切片中。但这都不意味着它具有泛化性。你可能花了一个季度去追踪团队甚至不知道存在的流量子集上的回归(regressions),又花了一个季度发布那些影响不可见的修复补丁,因为这些补丁改善的是没人阅读的切片。
四种采样策略及其适用场景
标注队列工具已经收敛到了几种采样策略。它们是不可互换的。每一个都回答了不同的问题,并产生了不同的偏见。
**随机采样(Random sampling)**为你提供整体质量的无偏视图。如果你想追踪系统在总体上是变好还是变坏,这是唯一无需修正就能给出答案的采样机制。代价是随机采样几乎将所有预算都花在了中位数案例上,而在尾部案例上几乎没有投入,而回归往往就发生在那里。
**分层采样(Stratified sampling)**将流量划分为不同的细分领域(segments)——用户级别、功能、请求类型、对话长度、语言——并在每个细分领域内进行采样。当系统针对不同人群的表现不同,且你需要在不被其他十个细分领域稀释的情况下检测出某个细分领域的回归时,这就是你需要的。分层将单一的汇总数字转变为一组细分级别的数字面板,其中每一个都真实地反映了其对应的人群。
**优先级采样(Priority sampling)**将稀有或有趣的 trace 推到前面:自动评分低、延迟高、用户报告的问题、两个裁判(judges)产生分歧的 trace。这是你为寻找新的失败模式而投入预算获得回报的地方。代价是,优先级采样的评分不代表整体质量——它们代表的是“优先级函数标记的事项”,这是一个不同的量。
**主动学习采样(Active-learning sampling)**要求系统本身标记出它最不自信或两个模型产生分歧的 trace,其前提假设是:在这些案例中,人工标签对你理解系统的改变最大。这是每小时人工时间提升评估信号杠杆率最高的采样机制,也是最容易与整体质量衡量相混淆的一种。
正确答案很少是单一的策略。一个可行的分配可能是:将 40% 的评分预算用于分层随机采样,以诚实地衡量整体质量;40% 用于优先级采样,以追踪已知的失败模式;20% 用于主动学习采样,以发现未知的失败模式。具体的分配比例并不如“分配是经过深思熟虑、书面记录并经过审查的”这一点重要。
抽样评分是一个核心设计维度
当标注员进度落后时,直觉反应是向队列中投入更多审核员,或者通过付钱给普通标注员来降低门槛,让他们对原本由领域专家评分的内容进行评分。这两种反应都承认了一个错误的假设:吞吐量应该与 Trace 量相匹配。事实并非如此。有趣的工程设计问题不是如何评得更多,而是在现有预算下如何评得更好。
这种视角的转变使“抽样评分”成为了一个真正的工程维度,而不仅仅是评测工具上的一个功能开关。你拥有固定的评分预算、已知的 Trace 分布以及一组相互竞争的目标:跟踪总体质量、捕获特定细分领域的回归、发现新的失效模式、为 LLM 裁判构建训练数据。你在其中一个目标上花费的每一次评分,都是在其他目标上节省下来的评分。这种分配是你需要负责的权衡。
在实践中,这意味着要像对待评测标准本身一样对待抽样策略:版本化、经过代码审查、有文档记录并附带变更日志。当策略发生变化时(随着产品的变化,它应该发生变化),过去的评分结果与未来的结果不具有直接可比性,评测项目需要明确说明这一点,而不是悄悄地移动标准。
这也意味着对策略进行仪表化(instrumenting)。你应该能够回答任何一周内:有多少 Trace 进入了队列,抽样了多少,采用了哪种策略,谁评分的,以及被抽样的部分与未抽样的群体在自动指标上的对比情况。如果这些数字发生剧烈偏差,抽样就会使评测产生偏见,而你可以看到这一点。如果你没有这些数据,偏见仍然会发生,只是你看不见。
LLM 裁判是队列压缩,而非队列替代
解决吞吐量问题的自然排气阀是 LLM-as-judge 层,它可以自动为每个 Trace 评分。如果使用得当,这可以将你的评测覆盖范围扩大几个数量级。如果将其用作人工评分的替代品,则会产生不同的失败:裁判有自己的偏见、盲点和漂移,一个绿色的 LLM 裁判仪表盘并不比一个从有偏见队列中构建的人工评分仪表盘更值得信赖。
正确的构思是,LLM 裁判是标注队列前的压缩层,而不是它的替代品。裁判为所有内容评分。人类对样本进行评分,这些样本是经过刻意选择以确保裁判诚实的:裁判不确定的案例、裁判尚未验证的细分领域的案例、为衡量一致性而随机抽取的案例,以及两个裁判模型意见不一的案例。人类的工作从“对 Trace 评分”转向“对裁判评分”,这才是杠杆作用所在。
将裁判视为具有回归测试集的模型。计算与预留的人工标注样本的一致性——Cohen's kappa 是一个合理的起点,绝对数值的重要性次于它是否在你更改裁判提示词、更换裁判模型或轮换人工团队时保持稳定。每月重新抽样。当一致性发生漂移时,你需要解决的是测量问题,而不是去追踪系统回归。
设计队列,让差距可见
最深层的修复是设计队列,使生成的 Trace 与评分的 Trace 之间的差距成为一个核心数字,显示在它旁边的评测分数旁。一个值得信赖的评测仪表盘应并排显示三个量:分数、计算该分数所依据的样本量,以及该样本占总流量的份额。当第三个数字在一个季度内悄悄地从 12% 下降到 2% 时,分数未必变得不那么准确,但其周围的置信区间已经变宽,领导团队需要看到这一点。
队列内部也是如此。仪表盘应区分已抽样但尚未评分的 Trace、已抽样并已评分的 Trace,以及从未被抽样的 Trace。第一个桶是你的积压工作;第二个是你的数据;第三个是你的评测程序不了解的“暗物质”。大多数标注工具都会显示前两个而隐藏第三个。第三个才是设计所在。
一旦差距可见,沟通就会变得更容易。团队可以讨论是投资更多的审核员、更好的抽样、更激进的 LLM 裁判压缩,还是从根本上减少进入队列的 Trace 量。每一个都是真正的杠杆。要避免的是那种无声的默认状态:队列在增长,预算没有增长,而分数却像什么都没发生一样继续显示。
标注员并没有停止阅读。队列的增长速度超过了他们的阅读速度,排序决定了哪些 Trace 在差距中幸存下来,评测程序慢慢变成了对排序函数的测量。修复方法不是增加标注员。而是将样本视为样本,将队列视为采样器,并将两者之间的差距视为页面上最重要的数字。
会员专享
余下内容仅对会员开放。
会员可读完整内容 —— 每一个公开发布的观点背后,那些框架、决策与推理的全貌。
- —完整文章,包含未公开存档的部分
- —可落地的工作框架,附带权衡与决策依据
- —新文章抢先看,先于公开发布
随时取消 · 一次订阅,畅读全部