你模型的置信度分数只是一种感觉,而非概率
一名客服代理正准备办理退款。在触发工具调用(tool call)之前,你的团队添加了一个门控:只有当模型表示其置信度至少达到 90% 时才继续。模型尽职地返回了 "confidence: 0.95",退款发出去了,而模型用来证明金额合理性的引用——一条关于损坏商品的政策条款——其实并不存在。它从未存在过。模型虚构了该条款,然后为自己的虚构给出了 95% 的评分。
这就是陷阱。团队倾向于使用模型的置信度数值,因为它看起来就像你从经过校准的分类器中获得的概率——即 0.9 意味着“十次中有九次是正确的”。但事实并非如此。大语言模型(LLM)自我报告的置信度就像其他任何 token 一样,只是听起来流畅的 token,它受到语气、措辞和训练激励的影响,而这些与底层声明是否属实几乎没有任何关系。
如果你根据那个数字来限制实际行动,你就是在根据一种“感觉(vibe)”来做决定。
这种困惑是可以理解的。在经典机器学习中,模型的输出概率是一个你可以追究责任的真实量:将模型标记为 "0.8" 的每一次预测放入一个桶中,检查其中有多少是正确的,一个表现良好的模型其准确率会接近 80%。这种属性被称为“校准(calibration)”,而这正是你在编写 if confidence > threshold 时真正想要的东西。问题在于,你的团队中没有人衡量过你的 LLM 是否具备这种属性,而默认的答案是:它不具备。
校准是你从未衡量过的属性
校准只问一个问题:当模型说概率为 P 时,它在 P 的时间比例里是正确的吗?你可以通过可靠性图表(reliability diagram)来测试它。按声明的置信度对每个预测进行分桶,在 x 轴上绘制平均声明置信度,在 y 轴上绘制观察到的准确率,一个完美校准的系统会追踪 45 度的对角线。低于该线的点意味着过度自信——模型声称的确定性高于其实际表现。
该差距的单数值总结是预期校准误差(Expected Calibration Error, ECE):即各桶中置信度与准确率之间的平均绝对距离。ECE 接近于零是理想的。ECE 为 0.2 意味着你的置信度数字平均偏差了 20 个百分点,这使得 "0.9" 的门控在功能上毫无意义。
以下是人们在生产级模型上实际运行此测试时的研究发现。经过 RLHF 微调的模型绝大多数会发出 80% 到 100% 之间的口头置信度——它们基本上忘记了如何说“我不确定”——在知识密集型任务中,ECE 甚至达到 0.30 或更高。即使是表现较好的模型也不完美:最近的一项医学问答研究衡量得出,最强模型的平均 ECE 约为 0.06,而另一款流行模型的 ECE 为 0.13,而且这还是在基准测试、受控条件以及模型的内省机 制发挥最佳水平的情况下得出的结果。
令人不安的结论是:模型往往在听起来最确定的时候最不准确。研究人员将此称为语言模型的“达克效应(Dunning-Kruger effect)”,这不是一个可以通过提示词(prompt)消除的 bug。它是通过模型的训练方式固化在其中的。
为什么 RLHF 会制造自信
过度自信并非随机噪音,而是一种训练出来的激励。在来自人类反馈的强化学习(RLHF)期间,奖励模型会为候选回答打分,而奖励模型对听起来自信的答案表现出系统性偏见,无论其是否正确。一个毫不含糊、果断的回答比一个准确但迟疑的回答获得的奖励更高。针对这种信号进行长时间优化,你就会得到一个学会了将确定性作为一种风格来展示的策略,这种确定性与内容的真实性是脱节的。
这就是为什么置信度数字会随着与正确性无关的事情而变动。重新表述问题,数字就会改变。改变采样温度(temperature),它也会改变。在系统提示词中加入“你是一个专家”,它还是会改变。置信度诱导甚至被作为一种攻击面进行研究——你仅通过提示工程就可以操纵声明的置信度,这之所以可能,是因为这个数字从未锚定在任何真实的事物上。
- https://arxiv.org/abs/2406.15927
- https://arxiv.org/abs/2509.25532
- https://arxiv.org/pdf/2502.04643
- https://link.springer.com/article/10.1007/s10916-026-02430-0
- https://arxiv.org/pdf/2509.21999
- https://arxiv.org/pdf/2509.00461
- https://arxiv.org/pdf/2407.08388
- https://www.emergentmind.com/topics/verbalized-confidence-scores
