跳转到主要内容

那个因冗长输出比更佳答案更能触发点击处理器的 A/B 测试赢家

阅读需 1 分钟Tian PanTian Pan

一项提示词变体(prompt-variant)实验在某款 AI 辅助搜索产品的生产流量上运行。成功指标是点击响应中的任何建议操作。变体 B 交付的响应长度增加了大约 40%,且包含更多列举出的选项。点击率(CTR)高出 11%,且具有三个九(99.9%)的统计显著性。该实验被判定为获胜并上线。

一个月后,每周客户满意度调查下降了两个点。没人将其与上线联系起来,因为实验已被记录为成功,团队已经转向其他工作。季度复盘最终将满意度下降追溯到提示词的更改,诊断结果令人难以接受:变体 B 胜出并不是因为它给了用户更好的答案,而是因为更长的回答包含了更多的点击表面(clickable surfaces)。点击处理器在每次展示中触发得更频繁,是因为有更多可点击的内容,而不是因为你阅读的内容更值得采取行动。

错误不在统计数据上。p 值是真实的,提升是真实的,样本量也是诚实的。错误在于成功指标衡量的是响应的“形状”(shape),而响应的形状是提示词变体可以在不改变潜在质量的情况下直接改变的东西。这场实验是在错误的维度上进行的一场公平竞争。

形状如何在无人作弊的情况下获胜

AI 产品的参与度指标在输出的表面积与任何单一参与事件触发的概率之间存在一种隐藏的耦合。点击率、操作调用率、建议后续动作采纳率 —— 每一项都是针对响应本身产生的事件进行计算的。一个包含三个建议操作的响应有三次触发指标的机会,而包含七个的则有七次。你并没有变得更感兴趣;而是响应变得更“好点”了。

这并非 LLM 所特有。产品团队多年来一直在衡量长内容的参与度,并且知道分页、无限滚动和推荐轮播都会通过增加参与项的库存来夸大参与计数。新鲜之处在于 LLM 改变输出形状的成本是多么低廉。仅需一行提示词修改,就能将答案从三个要点变成十个。无需设计评审,无需开发工单,也无需权衡用户体验。 “响应呈现多少表面积”的变动空间对任何提示词实验都是敞开的,任何与单次展示参与度相关的指标都会默默地奖励这种扩张,直到其他地方出现问题。

这种现象也延伸到了点击之外。当响应内容更长、阅读时间更久时,页面停留时间会上升。当有更多独立的块可以复制时,剪贴板复制率会上升。点赞按钮的点击量可能会增加,因为冗长的答案让你感觉更“完整”,即便它们在简短答案也会犯错的地方同样犯错,只是篇幅更长。你所衡量的任何处于“响应产生更多文本”下游的指标,都会奖励产生更多文本的行为。

为什么长度偏见有着似曾相识的渊源

如果“冗长即奖励”的失败模式听起来很耳熟,那确实应该如此。LLM 评估社区多年来一直在与基于评委(judge-based)对比中的长度偏见(length bias)作斗争。像 GPT-4 这样的模型,在被要求从两个候选响应中做出选择时,即使有明确的准则要求看重简洁性,也会系统性地更倾向于较长的响应。这种偏见是如此顽固,以至于从业者现在通常会发布长度归一化后的胜率,文献中也已明确命名了这一现象。

同样的动态正出现在更高一层的产品分析中。生产环境中的评委不是 LLM,而是点击处理器。其机制不同 —— 你点击更多是因为按钮更多,而不是因为你在认知上更喜欢长文本 —— 但失败模式在结构上是完全相同的。处于响应形状下游的指标,必然会向能够最大化其触发机会的响应形状倾斜。交付更长变体的团队所发现的,正是自聊天机器人时代开启以来一直扭曲 LLM-as-judge 基准测试的同一种长度偏见的产品化版本。

这种联系之所以重要,是因为它告诉你修复方法并非针对单次实验的一次性修正。修复必须成为实验系统本身的一种属性。任何针对输出形状可变的产品,利用参与度指标来运行提示词或模型变体的团队都面临风险。更长的变体往往会胜出。如果团队不将这种动态命名为每次实验的协变量(covariate),就会不断上线冗长的内容,直到数月后下游的满意度信号迫使他们进行清算。

指标完全是在各司其职

会员专享

余下内容仅对会员开放。

会员可读完整内容 —— 每一个公开发布的观点背后,那些框架、决策与推理的全貌。

  • 完整文章,包含未公开存档的部分
  • 可落地的工作框架,附带权衡与决策依据
  • 新文章抢先看,先于公开发布

随时取消 · 一次订阅,畅读全部

参考资料

保持联系,关注我获取更多内容

阅读需 10 分钟

让你的 A/B 测试整整一个季度都失效的嵌入模型轮换

为什么供应商端的嵌入模型升级会悄无声息地破坏你对检索功能的 A/B 测试,以及填补这一鸿沟的实验规范。

insider
embeddings
阅读需 9 分钟

当评估指标全看“感觉”时,你的 A/B 测试无法区分两个模型

点击率无法区分用户是真心喜爱一个模型还是仅仅在忍受它。在你信任实验结果并据此选择模型之前,请先证明你的指标能够检测出你故意搞坏的模型。

insider
evaluation
阅读需 10 分钟

撒谎的 AI A/B 测试:LLM 实验中的新奇效应、结转偏差与锚定偏差

三种心理偏差——新奇效应、锚定偏差和结转偏差——会系统性地夸大 AI 功能的 A/B 测试结果,而标准的留存组(Holdout Group)方案对这些都无能为力。本文将介绍一种真正有效的纵向队列设计(Longitudinal Cohort Design)。

insider
ab-testing
阅读需 10 分钟

金丝雀群组:按 ID 哈希的分流如何将核心用户聚集到同一实验组

对不透明 ID 进行均匀哈希并不等同于对用户进行均匀抽样。当 ID 分配与参与度相关联时,基于哈希分桶的金丝雀发布可能会悄无声息地将所有核心用户分配到同一个实验组,并报告一个虚假的增长结果。

insider
experimentation
阅读需 11 分钟

那个按会话分桶并导致 A/B 测试分群漂移的模型发布标志

当 Feature Flag SDK 按会话缓存、灰度发布更新了哈希盐值(Hash Salt),且分析脚本按事件发生时的标志值进行分组时,原本 4% 的满意度提升变成了一个干扰项。本文将探讨分群漂移是如何潜伏在运行正常的流水线中的,以及弥合这一差距的方法。

insider
ab-testing