跳到主要内容

审批疲劳:人机协同关口如何退化为橡皮图章

· 阅读需 11 分钟
Tian Pan
Software Engineer

引入“人机回圈”(Human-in-the-loop),你就有了一个控制点。每天在这个人面前摆上一百个审批请求,你得到的只是一个戴着控制点徽章的“橡皮图章”。在架构图上,两者看起来一模一样。但在负载之下,它们的表现完全不同,而两者之间的鸿沟,正是大多数“负责任的 AI”部署默默宣告失败的地方。

任何观察过安全运营中心(SOC)陷入困境的人对这种模式都不陌生。行业调查显示,未被调查的警报比例在四分之一到三分之二之间——一个经常被引用的数字是,62% 的警报被直接忽略,55% 的团队承认经常错过被他们归类为关键的警报。分析师并不懒惰。他们每天处理数千个警报,而误报率通常超过 50%,人类大脑对这种比例的反应正是你所预期的:它不再关注了。智能体 AI(Agentic AI)正通过一个又一个确认对话框,重新制造这种完全相同的故障模式。

令人不安的是,审批疲劳并不是你可以通过优化 UX 就能解决的烦恼。它是认知经济学的一个可预测后果。当阅读每一项提案的成本超过了感知收益时——因为过去 100 项中有 95 项都是正常的——理性的操作员会通过略读、模式匹配,然后反射性地点击“批准”来进行优化。Google DeepMind 的研究人员在 2025 年将其列为命名的“AI 智能体陷阱”之一,它值得你用对待内存泄漏一样的严谨态度来设计防御措施。

为什么人类不再阅读

在人因工程学文献中,这种机制有一个名字:自动化偏见(Automation bias)。这是一种过度信任自动化系统而低估自身判断的倾向,在智能体出现之前的几十年里,航空和医学领域就已经对其进行了测量。

一项关于临床决策支持中自动化偏见的系统性综述发现,当临床医生面对自信且大多正确的机器建议时,在很大一部分时间内会接受错误建议——研究报告显示,接受错误 AI 建议的比例在 6-11% 之间,一项计算病理学实验显示,最初“正确”的人类判断有 7% 的概率被错误的 AI 建议推翻。关键在于,时间压力不一定会增加偏见发生的“频率”,但会增加其“严重程度”。航空界在另一个标签下讲述了同样的故事——自动化自满(Automation complacency),飞行员如此完全地信任自动驾驶,以至于他们停止扫描仪表,并失去了在故障发生时接管所需的态势感知。

三种力量共同导致了这种退化:

  • 数量压倒了判断。 超过一定的吞吐量后,每个审核员都会从评估转向模式匹配。他们不再问“这正确吗?”,而是问“这看起来像之前正常的四十个吗?”
  • 可靠性孕育了脱节。 你的智能体变得越好,每次审批得到的关注就越“少”——而罕见的糟糕提案就变得越危险,因为没有人准备好去捕捉它。
  • 拒绝的代价是昂贵的。 如果说“不”意味着工作流停滞、提交理由或与被智能体自动化了工作的队友争论,那么阻力最小的路径就是说“是”。

请注意,这些问题都无法通过告诉人们“多加注意”来解决。注意力是被耗尽的资源。你无法通过劝诫来解决资源短缺问题。

当图章变成安全漏洞

橡皮图章化不仅是质量问题。它还是一个有记录的攻击面。

考虑一下审批流实际上在训练什么。如果每一个琐碎的、只读的操作——数据库查询、文件读取、状态检查——都需要确认,那么你就在进行成千上万次的重复训练,教会审核员一个道理:批准是安全的,批准是快速的。 你建立了一个条件反射。现在,一个能够影响智能体输出的攻击者——通过提示词注入(Prompt injection)、有毒文档或受损工具——只需要在常规操作流中埋入一个有后果的操作。恶意的“删除备份”或“电汇资金”带着与之前四百个无害查询相同的对话框出现,并得到了同样的反射性点击。

这就是“点击穿透漏洞”(Clickthrough vulnerability),它颠覆了统一设卡(Uniform gating)背后的直觉。为了“安全起见,要求对所有事情进行审批”的本能,恰恰制造了导致危险审批溜掉的注意力不集中。更多的关卡可能意味着“更少”的安全性。从攻击者的角度来看,一个频繁触发的监督过程与根本没有监督是无法区分的——除了它还会产生一个虚假地证明人类查看过的审计日志。

监管机构已经开始为此命名。欧盟《AI 法案》第 14 条关于高风险系统的人类监督,明确要求部署者使操作员能够“意识到自动依赖或过度依赖”AI 输出的可能倾向——也就是文中点名的自动化偏见。法律现在要求你针对橡皮图章化进行设计,而不只是安排一个人并称之为已治理。

识破“表演式监督”的迹象

加载中…
References:Let's stay in touch and Follow me for more thoughts and updates