·tian
当你的评测结果不一致时:在数据互相矛盾时的一套信号优先级体系
对于提示词变更,四种不同的评测信号很难完全一致。如果没有一套明确的优先级体系来规定在何种情况下以哪个信号为准,那么每个发布周都会变成一场关于“该信任谁的数据”的争论。
evals
llm-evaluation
ab-testing
judge-calibration
+1·tian
对非确定性 AI 功能进行 A/B 测试:为何你的实验框架假设了错误的零假设
标准 A/B 测试框架假设处理是确定性的,但 LLM 驱动的功能会引入处理内方差,从而破坏功效计算、膨胀样本量并产生不可靠的结果。本文为非确定性 AI 实验提供随机化、指标设计、贝叶斯方法和方差缩减的实践指南。
insider
ab-testing
llm
experimentation
+1显示第 13–14 篇,共 14 篇
上一页2 / 2