跳转到主要内容

8 含有标签「annotation」

Posts tagged "annotation" on TianPan.co.

查看所有标签

·tian

那些你团队的人员已悄然停止阅读的标注队列

标注者吞吐量是每个 LLM 评估计划的无声天花板,而队列排序则是无人设计的采样器。本文探讨如何将“为评分而采样”视为一等公民的工程界面。

insider
evals
annotation
observability
+1
·tian

标注偏移:评估集如何逐渐无法衡量你交付的产品

当评估分数上升而产品却在悄然衰退时,说明测量系统的校准已经失准。本文将探讨标注偏移如何隐蔽地发生,为什么评分标准和产品都在你脚下不断变化,以及保持评估数据真实性的四个关键动作。

evals
llm-ops
ai-engineering
observability
+1
·tian

标注经济学:每种标签来源背后隐藏的代价

在评测标签来源的选择上——人类领域专家、众包工人、LLM 合成生成和行为推断——的决策框架,以及何时「无标注」才是正确答案。

insider
evaluation
annotation
llm
+1
·tian

你的标注流水线才是 AI 产品的真正瓶颈

团队在反馈采集 UI 上投入大量精力,而下游的标注流水线 —— 架构版本管理、IAA 评分、队列优先级 —— 却无休止地滞后两个迭代。本文将告诉你如何解决这一问题。

insider
mlops
annotation
rlhf
+2
·tian

标注人力工程:你的标注员就是生产基础设施

大多数 ML 团队把标注当作采购问题来对待,实际上这是一个基础设施问题。本文介绍如何用与生产系统同等的严谨度来运营标注工作。

insider
machine-learning
data-engineering
mlops
+1
·tian

LLM作为标注器的质量控制:当标注者与学生共享训练数据

用LLM为另一个LLM的微调标注数据看似高效——直到两个模型都吸收了同样的互联网文本。本文阐述共享预训练如何造成系统性标注失效,以及真正有效的检测与缓解策略。

llm
fine-tuning
data-quality
annotation
+1
·tian

用稀疏标注构建 LLM 评估体系:你不需要一万个样本

大多数团队以等待足够标注数据为由,迟迟不投入评估体系建设。已有证据表明,通过主动学习、弱监督和 LLM 自动标注精心挑选的 50–200 个样本,完全能够产生可靠的评估信号。本文介绍如何在数据集尚小时就构建值得信赖的评估体系。

evaluation
llm
ai-engineering
evals
+1
·tian

标注流水线是生产级基础设施

为评估和微调运行人工标注是一个软件工程问题,但大多数团队却在用电子表格管理它。本文将探讨生产级标注基础设施的真实面貌,以及为什么标注者间一致性(IAA)是规范健康度的信号,而非人手多少的问题。

insider
annotation
mlops
data-quality
+1