针对付费用户群追踪数据进行模型优化的团队,其实是在一个“简单分布”上给自己打分。付费用户已经形成了一套工作流。他们之所以选择这款产品,是因为产品中的某些特质证明了刷信用卡付费的合理性,这意味着当他们进入评估集(eval set)时,已经学会了哪些提示词(prompts)有效,哪些功能给力,以及哪些“坑”不该踩。而免费层用户完全不是这样。他们是匿名的、探索性的,通常带有对抗性,且往往是非英语母语者,正在用第二语言对产品进行压力测试,他们触发了评估集从未涵盖的长尾失败模式。
这种不对称性正悄无声息地吞噬着每一个免费增值(freemium)AI 产品的转化漏斗。团队针对主要从付费追踪数据中提取的精选样本对模型进行评分。而免费层的那些“古怪”追踪数据——那些没有模板、用户正真诚地试图搞清楚产品能做什么的数据——从未被标注,从未进行回归测试,也从未为下一次提示词修改提供参考。模型在付费分布上变得越来越好,但在决定免费用户是否升级的分布上却慢慢变差。
转化数据令人不安地证实了这一点。大约三分之二的免费增值升级来自于用户在已经成功运行的任务上触碰了使用限制,而不是因为发现了某个高级功能。升级前的体验就是 免费层的体验。如果在这个体验中模型感觉是坏的,那么转化漏斗无法通过发送一封折扣邮件来修复。
付费用户群样本是经过修饰的高光时刻
付费用户的行为模式一旦被审视就会显得截然不同。他们已经通过免费试用搞清楚了提示词语法。他们已经发现了哪些问题能得到好的回答,哪些问题会得到混乱的响应。他们拥有围绕产品构建的工作流——一个带有提示词模板的 Notion 文档,一个重新运行相同每日查询的 Slack 提醒,习惯于将长请求拆分为小请求。他们生成的追踪数据格式良好、范围明确,且集中在少数几个意图中。
免费层用户完全没有这些“脚手架”。他们可能来自一条推文、一个并排对比、同事的推荐或纯粹的好奇心。他们像在搜索框输入内容一样打字,或者像对朋友说话,或者像在测试一个试图玩坏的模型。他们以付费群体不具备的比例使用非母语英语,因为付费群体往往过度集中在产品有营销活动且语言匹配的市场。他们会问产品不支持的问题,且不知道自己不该问。他们会为了好玩而尝试“越狱”。
这两个群体产生的追踪数据在性质上完全不同。在付费加权样本上的综合准确率只能说明模型处理好了它的“理想路径(happy path)”。它无法告诉你那些仍在犹豫是否付费的用户,是否获得了值得让他们升级的体验。
为什么评估集默认会向付费用户偏离
评估集并非随机采样,而是在团队关注的地方采样,而团队通常关注支持工单的来源。付费用户通过正式渠道投诉:Zendesk 工单、客户经理、来自采购负责人的 Slack 升级反馈。免费用户则通过流失来投诉。一个得到糟糕答案的免费用户不会写工单——他们会直接关闭标签页,并认为这个产品“不太好”。在 AI 团队有人标注这条数据之前,信号就已经消失了。
标注预算加剧了这一现象。领域专家很贵,编写评估案例很耗时,人们本能地会将预算花在通过工单渠道进入的案例上。半年后,评估集中拥有数百个来自付费追踪数据的精选示例,以及几个某人在红队测试周添加的合成对抗案例。而免费层的古怪追踪数据——那些真正能发现导致转化流失的回归测试数据——从未进入数据集,因为标注预算早已被占满。
此外,还存在一种更隐蔽的动态:评审员将免费层追踪数据视为“噪声”。一名初级产品经理在扫描失败案例时,看到一个明显格式错误的查询,将其标记为“用户错误”然后继续。但优雅地处理格式错误的查询正是 产品的职责,特别是在那些还没学会“正确格式”的用户群中。在那样的查询中掉链子的模型,就是无法通过“升级测试”的模型。
准则:有意识增加免费层权重的分层采样
解决方法不是对所有流量进行随机采样。随机采样会给你一个代表性分布,这几乎同样糟糕——它会让付费用户的理想路径仅凭数量就淹没长尾数据。真正的准则应该是分层采样,并明确增加免费层切片的权重。
一个可行的方案:
为每个追踪数据标记用户群标签。 每一条生产环境的追踪数据在摄入时都会被打上所属群体的标签:免费、试用、付费、内部。没有这个标签,任何准则都无法执行。
在评估集中设定免费层配额。 确定评估案例中必须来自免费层追踪数据的比例,并使其高于该群体在收入中的占比。如果免费用户占流量的 80% 但仅占收入的 5%,评估集仍可能将他们的权重设为 50%——因为评估集要回答的问题是“模型是否处理好了该分布”,而不是“模型是否处理好了收入”。
为每个用户群建立独立的拒绝率和有用性基准。 综合评分会掩盖用户群级别的退化。如果模型在付费用户上提升了 3%,在免费用户上退化了 2%,综合指标看起来是平稳的——但转化漏斗正在断裂。分群基准会强制让退化显示在某些人必须查看的仪表盘上。
建立“免费层作为金丝雀”的告警层。 免费层输出的遥测数据应在付费层遥测发现问题之前触发调查。免费层群体具有更高的方差、更怪异的输入和更快的反馈——如果你在关注,退化会首先在那里显现。
建立涵盖长尾类别的失败分类法。 模糊的查询、语码转换(混杂语言)的查询、来自尚未了解产品功能的用户查询、看起来像对抗性但实际不是的查询——这些都在失败分类法中拥有自己的类别和评估案例。如果没有明确的分类,它们会被归入“杂项”,并在优先级排期时输给高方量的类别。
这不是增加标注预算,而是重新分配标注预算。大多数评估项目的瓶颈在于标注能力,关键在于将其指向何处。将其指向决定转化成本的群体,比指向已经转化的群体是更划算的交易。
隐藏跨层级全貌的组织断层 即使是那些深谙此道的公司,这种不对称性的存在也有其结构性原因。增长团队掌握着转化漏斗的遥测数据——包括免费转付费率、升级所需时间、功能激活率等仪表盘。而 AI 团队则掌控着评估集(eval set)和模型质量仪表盘。这两个团队在路线图评审会议上碰头,但他们的数据存储在不同的仓库中,按不同的维度进行切片,并汇报给不同的领导。没有哪个团队拥有能在同一张图表中同时显示“免费层级模型质量”与“免费转付费转化率”的仪表盘,因为没有人被要求去构建这样的仪表盘。
其结果就是一种缓慢且隐形的退化。AI 团队发布了一个提示词(prompt)更改,使付费分布的表现提升了 1.5%。评估集显示这是一次进步。更改随后上线。两周后,免费转付费转化率下降了 80 个基点,增长团队开始调查注册引导流程的变化。六个月后,有人注意到转化率下降与那次提示词更改有关,但到那时,提示词已经又修改了四次,因果链条早已断裂。
组织层面的修复方法是建立一个由两个团队共同承担的共享指标。最简单的版本是:一个每周从分层抽样中计算出的“免费层级有用性得分”,由两个团队共同监控告警,并在评审转化指标的同一场合进行审查。该指标强迫双方进行对话。如果没有这种强制性指标,两个团队就会各自守着自己的仪表盘,而评估集则会发生漂移。
简明扼要的转化论据 在评估集中过度加权免费层级流量的论据,归根结底是一个关于单位经济效益的观察,而当团队抽象地思考“模型质量”时,这一点往往会被忽略。付费群体已经在付钱了。模型在付费分布上即便有轻微退化,大多数付费用户仍会继续付费——他们已经将产品整合到了工作流中,切换成本是真实存在的,小幅的质量退化虽然恼人,但不足以让他们放弃。对模型质量最敏感的群体是那些尚未做出承诺的群体。
免费用户在每一次使用中都在评估该产品是否值得付费。在最初的五次使用中,哪怕只有一次糟糕的回答,就足以让他们放弃这款产品——而且不会有任何工单告诉你发生了什么。未能给免费用户留下深刻印象的模型会让你损失一次转化,而你永远无法将此衡量为一种损失,因为用户从一开始就没转化。这看起来像是正常的漏斗流失数字,而不是模型质量问题,AI 团队永远看不到这一点。
转化率的计算放大了这一点。如果一款免费增值产品将 3% 的免费用户转化为付费用户,那么因模型质量下降导致损失 10% 的转化,其带来的收入损失要比付费体验下降 10% 所造成的损失更多——因为转化是未来每一分付费收入的源头。针对付费追踪数据进行评分的评估集,是在针对一个已经变现的群体进行评分,而那些尚未赚到的钱则存在于被评估集忽略的群体中。
架构层面的认知 信号密度最高的群体并不是付钱给你的群体,而是那些仍在犹豫不决的群体。免费层级的流量更难打标签,每个活跃用户的生成量较低,产生的工单较少,且包含更多噪声——尽管如此,这正是你的转化漏斗被评分的分布。如果团队将收入权重与评估权重混为一谈,就是在错误的样本上进行评分,而那些导致转化流失的退化永远不会浮现,直到一个季度后它们表现为增长仪表盘上一条毫无起色的平滑线。
这种视角的转变虽小,但影响深远:免费层级不是营销漏斗。免费层级是生产环境的分布。不以此为标准的评估集只是一个针对已转化群体的“精心挑选的高光集锦”——它对保持付费用户的满意度有用,但在告诉你下一批免费用户是否会在下个月付钱方面毫无用处。分层抽样、免费层级过加权、各群体基准线以及跨团队强制指标,这些准则能将评估集从一种“留存产物”转变为一种“增长产物”。构建它的团队不再在简单的分布上评分,而是开始在真正决定业务生死的分布上评分。
会员专享
余下内容仅对会员开放。 会员可读完整内容 —— 每一个公开发布的观点背后,那些框架、决策与推理的全貌。
— 完整文章,包含未公开存档的部分 — 可落地的工作框架,附带权衡与决策依据 — 新文章抢先看,先于公开发布 登录以继续阅读→ 随时取消 · 一次订阅,畅读全部