·tian
方差正在吞噬实验:为什么传统的 A/B 测试功效计算不适用于 LLM 功能
经典的 A/B 测试数学模型假设每个用户的行为是确定的。LLM 功能两次打破了这一假设,导致标准的样本量模板在两个方向上都给出了错误的判断 —— 本文介绍了修复这一问题的四个转变。
insider
experimentation
ab-testing
llm
+2·tian
当处理方案不确定时如何对 AI 功能进行 A/B 测试
当你的处理方案是 LLM 时,标准 A/B 测试就会失效——输出因每次调用而异,模型更新在实验进行中途上线,而「成功」又难以被清晰量化。以下是使实验结果仍然可信的统计调整方法和实验模式。
experimentation
llm
statistics
ai-engineering
·tian
你的 LLM 评估在欺骗你:统计功效问题
大多数 LLM 评估套件在 50–200 个样本上运行,却声称具有实际上并不存在的显著性。以下是数学原理,说明为什么你的评估无法检测你正在进行的改进——以及该怎么做。
insider
llm
evaluation
statistics
+1·tian
对非确定性 AI 功能进行 A/B 测试:为何你的实验框架假设了错误的零假设
标准 A/B 测试框架假设处理是确定性的,但 LLM 驱动的功能会引入处理内方差,从而破坏功效计算、膨胀样本量并产生不可靠的结果。本文为非确定性 AI 实验提供随机化、指标设计、贝叶斯方法和方差缩减的实践指南。
insider
ab-testing
llm
experimentation
+1