用户打开你的聊天窗口,提了一个问题,得到一个评估套件打分为 4.6(满分 5 分)的回答。接着,他们换了一种说法问了同样的问题。同样的回答,同样的分数。他们又试了一次,这次用了人们在怀疑机器没在听时常用的套话——“我实际上想做的是……”——然后他们关闭了标签页。从模型的视角来看,这是三个干净的问答轮次。从仪表盘的视角来看,这是一个活跃的会话。但从用户的视角来看,这是一个连续三次失败的产品,而且以后再也不会打开了。
这就是“单轮评估”(per-turn evaluation)无法察觉的失效模式。孤立来看,每一轮对话似乎都是正确的。裁判(Judge)给了赞。幻觉检测器保持沉默。相关性评分很高。然而,整个对话作为整体并没有解决任何问题——而这正是用户真正评估你的单位。
错误在于将用户的每一轮对话视为评估分布中的独立抽样,而实际上,同一会话中来自同一用户的连续轮次是深度相关的。如果第 N+1 轮在语义上等同于第 N 轮,你看到的不是一个新查询——你看到的是同一个查询,由于之前的回答没有奏效而再次出现。将其计为两次活跃轮次而不是一个未解决的轮次,正是导致“模型表现良好”与“用户正在流失”之间的鸿沟在一个季度内都无法被察觉的原因。
重复提问会话的形态
这种模式具有足够的结构化特征,足以被命名。同一个用户,同一个会话。两个或更多指向相同底层意图的轮次。在重新表述中带有越来越多的沮丧标记——套话、语气升级、明确提及之前的轮次(“就像我之前说的”、“不,我问的不是那个”)。以及一个并非“解决问题”的终结动作:关闭标签页、问一个完全不同的问题、提交支持工单,或者——对你的留存数据来说最糟糕的情况——再也不回来了。
行业数据开始为此提供量化支持。研究多轮 LLM 行为的研究人员发现,一旦需求规范分散在多个轮次中,模型就会“迷失方向”;而且高频率的重新表述(重试超过两次)是对话破裂的可靠指标。对话式支持系统的研究将重复提问视为主要的沮丧信号,与突然终止、负面情绪以及切换到人工座席并列。Amazon Alexa 团队专门构建了上下文重新表述检测,因为这种摩擦信号足够强烈,足以支撑起一个专用模型。
这种指标之所以如此容易被漏掉,是因为这些信号都不会出现在单轮质量评分中。按照你的标准评分的轮次级 LLM-as-judge 无法知道用户在两分钟前已经问过同样的问题,并得到了一个类似但无用的回答。裁判看到一个输入、一个输出,打分,然后继续。会话的弧线(session arc)在设计上对它就是不可见的。
为什么单轮评估在通过遗漏撒谎
单轮评估本身并没有错。它回答了它被要求回答的问题:这个回答针对这个提示词而言是否高质量?问题在于,它被问到的问题并不是业务需要回答的问题。业务问题是:这个对话作为一个整体,是否解决了用户的实际需求?
这两者并不是同一个指标。一个回答可以技术上正确、事实准确且语法优雅,但仍然在对话层面失败,因为它回答的是问题的字面表述,而不是背后的潜在需求。这就是为什么支持行业框架长期以来一直区分分流率 (deflection rate,机器人关闭了会话)、拦截率 (containment rate,用户没有升级到人工)和解决率 (resolution rate,用户的实际问题消失了)。前两个很容易衡量也容易作弊。第三个才是与留存率相关的指标。
单轮质量更接近于分流而非解决。它告诉你每一次交换是否格式良好,而不是这些交换的累积效果是否有用。一个包含五次高质量但相互冗余的、针对同一个重复问题的回答,在单轮质量上得分很高,但在解决率上得分为零。
还有一个更难接受的推论:你的“高质量”回答中有一部分只是模型的礼貌层在对同一个“非回答”进行包装。裁判奖励的是流畅度,而用户想要的是他们要求的东西。
构建检测流水线
检测重复提问的形态在技术实现上很简单,但几乎没有人上线这个功能。一个最小可行(MVP)的检测器包含四个活动部件。
跨轮次的意图聚类。 使用句子嵌入模型(如 Sentence-BERT 类或托管的等效模型)对会话中的每个用户轮次进行向量化,并在最后 N 轮的滚动窗口内计算成对余弦相似度。当两个或多个用户轮次的意图聚类相似度超过可调阈值(0.75 到 0.85 是句子嵌入的一个合理起始区间,你需要根据自己流量的小规模手动标注样本进行微调)时,标记该会话。开放意图发现(Open-intent-discovery)技术多年来一直被用于工单分拣;这里的创新之处在于将其作为质量信号在单个会话内 运行,而不是为了构建分类体系而跨会话运行。
沮丧信号分类。 一个小型分类器——甚至是带严谨评分标准的廉价 LLM 调用——为每个用户轮次的沮丧程度打分。它捕捉套话、语气升级、重复标记(“又来了”、“仍然”、“正如我所说”)以及明确的不满(“这没有回答我的问题”)。最近关于任务导向对话中用户沮丧感的研究表明,即使存在类别不平衡,一旦你有了几千个标注轮次,基于 Transformer 的沮丧分类器就能达到可用的 F1 分数。你在这里不需要顶尖的准确率——你需要的是一个与最终“未解决”状态相关联 的信号。
从后续动作确认解决情况。 将用户的下一个动作视为前一个回答的隐式标签。他们关闭标签页了吗?那是放弃。他们从回答中复制文本了吗?那很可能是已解决。他们问了一个完全不同的问题吗?可能已经解决到足以继续下一步。他们重新表述了同一个问题吗?几乎肯定未解决。动作就是标签;你不需要问用户“这是否有帮助?”——你需要通过客户端埋点来记录他们接下来的行为。区分分流和解决的 Mavenoid 分析直截了当地指出:唯一真实的解决率是根据 24 到 48 小时内的重复联系来衡量的。
每会话滚动评分。 将这三个信号组合成一个会话级的“此对话是否正在解决问题?”的评分,并随每一轮更新。具体的权重并不重要,重要的是该评分作为一个**会话范围(session-scoped)**的产物存在,你的仪表盘、告警和评估集可以挂载在上面。没有这个,你只是多了三个没人能正确聚合的轮次级信号;有了它,你就拥有了一个在用户真正流失之前就能触发的流失领先指标。
隐藏在此处的组织缝隙 大多数公司之所以没有落地这项指标,其原因并非技术性的,而是组织性的。AI 团队负责模型、提示词(Prompt)以及单轮对话的评估集。支持团队负责工单量。增长团队负责转化漏斗和流失分析。每个团队都有自己的仪表盘,而将它们联系在一起的单次会话链路(per-session arc)却不在任何人的 KPI 里。
于是,AI 团队报告称质量得分有所提高,并发布了一份值得庆祝的更新日志。支持团队报告称,“AI 无法帮到我”的工单量正在悄然上升。增长团队报告称,免费转付费的转化率出现了轻微下滑,并将其归因于季节性因素。六个月后,有人进行了同期群分析(cohort analysis),发现那些在首次会话中与 AI 交互三次或以上的用户,其转化率仅为那些交互一次即停止用户的二分之一 —— 现在的疑问是,这种情况已经持续多久了。
成本最低的组织修复方案是将会话级解决率指标作为一个共享产物:由 AI 团队进行埋点,由数据团队进行汇总,并在讨论支持量和转化率的每周例会中同步展示。一旦它作为一个大家会争论的数字存在,这种失败模式就不再是隐形的了。如果不发布这项指标,其代价就是这三个团队将继续针对那些无法转化为留存率的指标进行局部优化。
无人揭示的 Token 经济学 还有一个更隐秘的成本框架也应该摆在台面上。重复提问的会话不仅是质量上的失败,它还是一种特定形式的成本失败。用户在第一轮提问,模型消耗了 Token。第二轮用户换个说法又问了一遍,模型再次消耗 Token,而且通常带有更长的上下文窗口,因为第一轮的内容现在已经变成了历史记录。第三轮重复循环,上下文更多。在第三轮消耗的边际 Token 是花在一个在统计学上极不可能转化的用户身上的 —— 而且,即使他们转化了,他们的流失速度也会比在第一轮就解决问题的用户群体更快。
从毛利的角度来看,这些后续对话的单位经济效益比第一轮更差。用户没有向你支付任何费用(或者支付的是不随会话长度增加而变化的固定订阅费),而随着他们陷入未解决问题的循环越深,你每轮投入的计算成本就越高。2025 年开始出现的 AI 流失潮评论指出,AI 产品极大地缩短了价值实现时间(time-to-value)窗口,以至于那些在第一次会话中没有看到结果的用户,在任何经典的流失信号触发之前就已经取消了。
从架构角度解读:在未解决的重复提问会话中,每一次额外的对话轮次都是一个负毛利的 Token 决策。没有接入重复提问检测的团队不仅是在用错误的指标给自己评分,还在亏本将算力卖给那些最不可能给其回馈的用户群体。
到底该交付什么 按照成本最低、回报最快的顺序,分为以下三个具体步骤:
首先,对“下一步行动”信号进行埋点。 这是三个组件中成本最低的 —— 你只需要记录已经可以访问的客户端状态。关闭标签页、复制事件、后续提问、转人工服务。这个标签是免费的;你只需要选择是否把它记录下来。
其次,添加基于 Embedding 的意图对比。 同一会话,最后 N 轮,计算余弦相似度(cosine similarity)。你不需要新模型 —— 你只需要在你已经在记录的用户对话上运行现有模型,并在你的追踪模式(trace schema)中增加一个派生字段。
第三,将滚动的会话解决率评分接入 AI 团队和支持团队都在查看的仪表盘中。 不是新建一个仪表盘。就在现有的那个里。重点是将指标放在组织缝隙所在的地方,而不是创建第四个仪表盘让缝隙隐藏在后面。
一旦这些措施落地,你就可以按照对话的实际流向来运行你的评估集(eval set)。未解决的重复提问会话变成了经过标注的失败案例,而这些案例是那些精心策划的测试从未想象过的 —— 这正是单轮标注系统性忽略的长尾问题。你的评估集将从“模型是否很好地回答了这个提示词”演变为“模型是否解决了用户的需求”,而这才是业务最终关心的核心问题。
展望未来,结论很简单。AI 质量是一个会话级的属性。当产品只是单次补全(single-shot completions)时,单轮评估是一个有用的近似值;但一旦你的产品变成对话,逐轮评估就像是通过检查每一帧是否对焦来给电影评分,却忽略了剧情是否交代清楚一样。构建跨轮次检测吧。不这样做的团队,正自信满满地根据一个完全漏掉了核心失败模式的指标给自己打分。
会员专享
余下内容仅对会员开放。 会员可读完整内容 —— 每一个公开发布的观点背后,那些框架、决策与推理的全貌。
— 完整文章,包含未公开存档的部分 — 可落地的工作框架,附带权衡与决策依据 — 新文章抢先看,先于公开发布 登录以继续阅读→ 随时取消 · 一次订阅,畅读全部