跳到主要内容

1 篇博文 含有标签「data-annotation」

查看所有标签

评估背后的隐藏运营组织:标注者经济学

· 阅读需 10 分钟
Tian Pan
Software Engineer

你的评估套件报告了一个数字。那个数字背后是一个标签。标签背后是一个人 —— 通常是一个你从未见过的人,通过 WhatsApp 管理着为期两周的零工,通过移动支付应用领取报酬,对只有 15 秒阅读时间的模型输出进行排序。你提交给副总裁的评估分数、阻止你部署的回归门禁、你放在发布博客中的排行榜排名 —— 这一切都继承了那个人在那个下午的注意力质量。

我们谈论评估(evals)时,仿佛它们是仪器:经过校准、可重复且客观。事实并非如此。评估是一种测量设备,其传感器是人力劳动流水线,而大多数团队只为测试框架做预算,却将人视为免费输入。这种会计错误正是评估分数漂移、你的“地面真值”(ground truth)前后矛盾,以及前沿 AI 最昂贵的瓶颈不再是算力的原因。