跳转到主要内容

18 含有标签「llm-as-judge」

Posts tagged "llm-as-judge" on TianPan.co.

查看所有标签

·tian

你的 LLM Judge 存在长度偏见、位置偏见和格式偏见 —— 且无人审计你的模型

LLM-as-judge 存在的长度、位置和格式偏见,正悄无声息地将 Prompt 迭代变成一台古德哈特机器。通过三次审计和版本化评判可以解决这一问题。

insider
llm
evaluation
ai-engineering
+1
·tian

RLAIF 末日循环:当廉价的反馈信号悄然毒害你的微调模型

AI 生成的偏好标签比人类标签便宜 100 倍 —— 它们教导你的模型去迎合裁判的审美,而不是你的用户。

rlaif
rlhf
fine-tuning
llm-as-judge
+1
·tian

LLM-as-Judge 漂移:当你的评估器升级导致所有数据变动时

如果回归测试套件在没有任何提示词更改的情况下变红,通常问题出在裁判身上,而不是候选模型。本文探讨评估器漂移如何制造虚假的胜负,为什么固定裁判和校准频率至关重要,以及在评估元数据中应记录哪些内容以防止仪表盘数据误导。

llm-evaluation
llm-as-judge
ai-engineering
evals
+1
·tian

裁判模型独立性:当评分者与被评分者共享盲点时,你的评测为何会失效

使用同一模型家族同时担任产品和裁判会因共享盲点导致评分虚高 8–16%。本文介绍如何构建真正能捕获模型遗漏问题的评测系统。

insider
evaluation
llm-as-judge
ai-engineering
+1
·tian

LLM 评估:什么才真正有效,什么是在浪费时间

一份面向从业者的 LLM 评估指南 —— 为什么错误分析先于基础设施、LLM-as-judge 何时有效、如何避免基准测试分数陷阱,以及为什么评估工作永无止境。

llm-evaluation
evals
ai-engineering
llm-as-judge
·tian

为什么你的 LLM 评估器失准了 —— 以及数据优先的修复方案

大多数团队在阅读数据之前就开始编写 LLM 评估标准 —— 这种本末倒置的做法正是评估器错过最关键失败案例的原因。数据优先的工作流、二元标签以及针对留出集的妥善验证可以从根本上解决这一问题。

llm-evaluation
ai-engineering
evals
llm-as-judge
显示第 13–18 篇,共 18 篇
上一页2 / 2