·tian
达成共识的 LLM-as-Judge 集成:只因评委都来自同一家族
一个由同一供应商家族构成的 LLM-as-judge 集成,测量的是家族内部的一致性,而非判断质量。所谓的高一致性评分,不过是某种无人提及的供应商选择偏差的产物。
llm-as-judge
evaluation
ensemble
bias
·tian
撒谎的 AI A/B 测试:LLM 实验中的新奇效应、结转偏差与锚定偏差
三种心理偏差——新奇效应、锚定偏差和结转偏差——会系统性地夸大 AI 功能的 A/B 测试结果,而标准的留存组(Holdout Group)方案对这些都无能为力。本文将介绍一种真正有效的纵向队列设计(Longitudinal Cohort Design)。
insider
ab-testing
llm
experimentation
+2·tian
你一直在忽略的偏见审计:如何为 LLM 流水线构建人口特征公平性
安全过滤器和公平性检查是不同的问题,需要不同的工程响应。针对性别、种族和语言群体的输出质量差异不会在你的护栏机制中体现 —— 这里有一套能在发布前捕捉这些差异的方法论。
insider
llm
fairness
bias
+2