跳转到主要内容

17 含有标签「experimentation」

Posts tagged "experimentation" on TianPan.co.

查看所有标签

·tian

方差正在吞噬实验:为什么传统的 A/B 测试功效计算不适用于 LLM 功能

经典的 A/B 测试数学模型假设每个用户的行为是确定的。LLM 功能两次打破了这一假设,导致标准的样本量模板在两个方向上都给出了错误的判断 —— 本文介绍了修复这一问题的四个转变。

insider
experimentation
ab-testing
llm
+2
·tian

缺失的实验组:你的 AI 实验缺少 “关闭 AI” 的对照组

大多数 AI 实验只是在对比 “更好的 AI” 和 “较差的 AI”,而忽略了真正关键的对比 —— 与 “完全没有 AI” 的情况进行比较。空白对照组(Null Arm)是目前缺失的一种规范,这种缺失导致团队无法衡量他们的推理支出是否真正带来了收益。

experimentation
ai-product
holdouts
incrementality
·tian

当处理方案不确定时如何对 AI 功能进行 A/B 测试

当你的处理方案是 LLM 时,标准 A/B 测试就会失效——输出因每次调用而异,模型更新在实验进行中途上线,而「成功」又难以被清晰量化。以下是使实验结果仍然可信的统计调整方法和实验模式。

experimentation
llm
statistics
ai-engineering
·tian

为什么 A/B 测试对 AI 功能失效(以及应该改用什么)

标准 A/B 测试在应用于 AI 功能时会失效。非确定性输出、新奇偏差和协变量漂移会使结果失效——以下是真正有效的测量方法。

ai
experimentation
product-engineering
measurement
·tian

对非确定性 AI 功能进行 A/B 测试:为何你的实验框架假设了错误的零假设

标准 A/B 测试框架假设处理是确定性的,但 LLM 驱动的功能会引入处理内方差,从而破坏功效计算、膨胀样本量并产生不可靠的结果。本文为非确定性 AI 实验提供随机化、指标设计、贝叶斯方法和方差缩减的实践指南。

insider
ab-testing
llm
experimentation
+1
显示第 13–17 篇,共 17 篇
上一页2 / 2