·tian
方差正在吞噬实验:为什么传统的 A/B 测试功效计算不适用于 LLM 功能
经典的 A/B 测试数学模型假设每个用户的行为是确定的。LLM 功能两次打破了这一假设,导致标准的样本量模板在两个方向上都给出了错误的判断 —— 本文介绍了修复这一问题的四个转变。
insider
experimentation
ab-testing
llm
+2·tian
缺失的实验组:你的 AI 实验缺少 “关闭 AI” 的对照组
大多数 AI 实验只是在对比 “更好的 AI” 和 “较差的 AI”,而忽略了真正关键的对比 —— 与 “完全没有 AI” 的情况进行比较。空白对照组(Null Arm)是目前缺失的一种规范,这种缺失导致团队无法衡量他们的推理支出是否真正带来了收益。
experimentation
ai-product
holdouts
incrementality
·tian
当处理方案不确定时如何对 AI 功能进行 A/B 测试
当你的处理方案是 LLM 时,标准 A/B 测试就会失效——输出因每次调用而异,模型更新在实验进行中途上线,而「成功」又难以被清晰量化。以下是使实验结果仍然可信的统计调整方法和实验模式。
experimentation
llm
statistics
ai-engineering
·tian
为什么 A/B 测试对 AI 功能失效(以及应该改用什么)
标准 A/B 测试在应用于 AI 功能时会失效。非确定性输出、新奇偏差和协变量漂移会使结果失效——以下是真正有效的测量方法。
ai
experimentation
product-engineering
measurement
·tian
对非确定性 AI 功能进行 A/B 测试:为何你的实验框架假设了错误的零假设
标准 A/B 测试框架假设处理是确定性的,但 LLM 驱动的功能会引入处理内方差,从而破坏功效计算、膨胀样本量并产生不可靠的结果。本文为非确定性 AI 实验提供随机化、指标设计、贝叶斯方法和方差缩减的实践指南。
insider
ab-testing
llm
experimentation
+1显示第 13–17 篇,共 17 篇
上一页2 / 2