跳转到主要内容

14 含有标签「ab-testing」

Posts tagged "ab-testing" on TianPan.co.

查看所有标签

·tian

那个因冗长输出比更佳答案更能触发点击处理器的 A/B 测试赢家

为什么基于参与度指标的提示词实验往往会发布更长的变体,以及在满意度下降迫使人们重新审视之前,如何识别那些将回复形式与回复质量脱钩的模式。

insider
ab-testing
llm-evaluation
product-metrics
+1
·tian

金丝雀群组:按 ID 哈希的分流如何将核心用户聚集到同一实验组

对不透明 ID 进行均匀哈希并不等同于对用户进行均匀抽样。当 ID 分配与参与度相关联时,基于哈希分桶的金丝雀发布可能会悄无声息地将所有核心用户分配到同一个实验组,并报告一个虚假的增长结果。

insider
experimentation
ab-testing
rollout
+2
·tian

那个按会话分桶并导致 A/B 测试分群漂移的模型发布标志

当 Feature Flag SDK 按会话缓存、灰度发布更新了哈希盐值(Hash Salt),且分析脚本按事件发生时的标志值进行分组时,原本 4% 的满意度提升变成了一个干扰项。本文将探讨分群漂移是如何潜伏在运行正常的流水线中的,以及弥合这一差距的方法。

insider
ab-testing
feature-flags
llm-rollout
+2
·tian

系统提示词提供的人格,模型每次都会以同样的方式选择

当你的系统提示词要求模型在不同人格之间做出选择时,模型的训练先验决定了结果——在实验平台察觉到之前,你的 A/B 测试分支就已经坍缩了。

insider
llm
ab-testing
experimentation
+2
·tian

让你的 A/B 测试整整一个季度都失效的嵌入模型轮换

为什么供应商端的嵌入模型升级会悄无声息地破坏你对检索功能的 A/B 测试,以及填补这一鸿沟的实验规范。

insider
embeddings
ab-testing
rag
+2
·tian

你的模型已经学会通过可见输入预测的那个功能开关

当路由哈希与 Prompt 组装器共享输入时,LLM Prompt 实验就会发生策略泄漏 —— 本文将深入探讨这种虚假提升是如何产生的、仪表盘无法显示的症状,以及弥合这一差距的工程实践。

insider
experimentation
llm-engineering
ab-testing
+2
·tian

那些悄悄共享长期记忆的智能体 A/B 测试变体

在 A/B 测试变体之间共享长期记忆存储会导致实验本身产生耦合——变体 B 读取了变体 A 写入的记忆,导致测量的增量发生漂移,最终上线后的表现会退化到同一受污染环境下的另一个点上。

ab-testing
ai-agents
memory
experimentation
+1
·tian

当两个 AI 功能争夺同一次点击

两个 AI 功能可以各自通过 A/B 测试,却仍然让产品变差。跨功能的注意力竞争是任何团队级仪表盘都看不到的组合问题。

ai-product
engineering-leadership
product-portfolio
ab-testing
+1
·tian

当评估指标全看“感觉”时,你的 A/B 测试无法区分两个模型

点击率无法区分用户是真心喜爱一个模型还是仅仅在忍受它。在你信任实验结果并据此选择模型之前,请先证明你的指标能够检测出你故意搞坏的模型。

insider
evaluation
ab-testing
llm
+2
·tian

稀疏信号问题:当无法进行 A/B 测试时如何衡量 AI 功能质量

B2B AI 功能鲜少拥有足够的日活用户来支撑 A/B 测试。本文介绍如何在频率统计无法规模化时,利用贝叶斯方法、代理信号和结构化专家知识获取来衡量质量。

insider
ai-evaluation
ab-testing
bayesian
+2
·tian

撒谎的 AI A/B 测试:LLM 实验中的新奇效应、结转偏差与锚定偏差

三种心理偏差——新奇效应、锚定偏差和结转偏差——会系统性地夸大 AI 功能的 A/B 测试结果,而标准的留存组(Holdout Group)方案对这些都无能为力。本文将介绍一种真正有效的纵向队列设计(Longitudinal Cohort Design)。

insider
ab-testing
llm
experimentation
+2
·tian

方差正在吞噬实验:为什么传统的 A/B 测试功效计算不适用于 LLM 功能

经典的 A/B 测试数学模型假设每个用户的行为是确定的。LLM 功能两次打破了这一假设,导致标准的样本量模板在两个方向上都给出了错误的判断 —— 本文介绍了修复这一问题的四个转变。

insider
experimentation
ab-testing
llm
+2
显示第 1–12 篇,共 14 篇
1 / 2下一页