跳转到主要内容

审批疲劳:人机协同关口如何退化为橡皮图章

阅读需 1 分钟Tian PanTian Pan

引入“人机回圈”(Human-in-the-loop),你就有了一个控制点。每天在这个人面前摆上一百个审批请求,你得到的只是一个戴着控制点徽章的“橡皮图章”。在架构图上,两者看起来一模一样。但在负载之下,它们的表现完全不同,而两者之间的鸿沟,正是大多数“负责任的 AI”部署默默宣告失败的地方。

任何观察过安全运营中心(SOC)陷入困境的人对这种模式都不陌生。行业调查显示,未被调查的警报比例在四分之一到三分之二之间——一个经常被引用的数字是,62% 的警报被直接忽略,55% 的团队承认经常错过被他们归类为关键的警报。分析师并不懒惰。他们每天处理数千个警报,而误报率通常超过 50%,人类大脑对这种比例的反应正是你所预期的:它不再关注了。智能体 AI(Agentic AI)正通过一个又一个确认对话框,重新制造这种完全相同的故障模式。

令人不安的是,审批疲劳并不是你可以通过优化 UX 就能解决的烦恼。它是认知经济学的一个可预测后果。当阅读每一项提案的成本超过了感知收益时——因为过去 100 项中有 95 项都是正常的——理性的操作员会通过略读、模式匹配,然后反射性地点击“批准”来进行优化。Google DeepMind 的研究人员在 2025 年将其列为命名的“AI 智能体陷阱”之一,它值得你用对待内存泄漏一样的严谨态度来设计防御措施。

为什么人类不再阅读

在人因工程学文献中,这种机制有一个名字:自动化偏见(Automation bias)。这是一种过度信任自动化系统而低估自身判断的倾向,在智能体出现之前的几十年里,航空和医学领域就已经对其进行了测量。

一项关于临床决策支持中自动化偏见的系统性综述发现,当临床医生面对自信且大多正确的机器建议时,在很大一部分时间内会接受错误建议——研究报告显示,接受错误 AI 建议的比例在 6-11% 之间,一项计算病理学实验显示,最初“正确”的人类判断有 7% 的概率被错误的 AI 建议推翻。关键在于,时间压力不一定会增加偏见发生的“频率”,但会增加其“严重程度”。航空界在另一个标签下讲述了同样的故事——自动化自满(Automation complacency),飞行员如此完全地信任自动驾驶,以至于他们停止扫描仪表,并失去了在故障发生时接管所需的态势感知。

三种力量共同导致了这种退化:

  • 数量压倒了判断。 超过一定的吞吐量后,每个审核员都会从评估转向模式匹配。他们不再问“这正确吗?”,而是问“这看起来像之前正常的四十个吗?”
  • 可靠性孕育了脱节。 你的智能体变得越好,每次审批得到的关注就越“少”——而罕见的糟糕提案就变得越危险,因为没有人准备好去捕捉它。
  • 拒绝的代价是昂贵的。 如果说“不”意味着工作流停滞、提交理由或与被智能体自动化了工作的队友争论,那么阻力最小的路径就是说“是”。

请注意,这些问题都无法通过告诉人们“多加注意”来解决。注意力是被耗尽的资源。你无法通过劝诫来解决资源短缺问题。

当图章变成安全漏洞

橡皮图章化不仅是质量问题。它还是一个有记录的攻击面。

考虑一下审批流实际上在训练什么。如果每一个琐碎的、只读的操作——数据库查询、文件读取、状态检查——都需要确认,那么你就在进行成千上万次的重复训练,教会审核员一个道理:批准是安全的,批准是快速的。 你建立了一个条件反射。现在,一个能够影响智能体输出的攻击者——通过提示词注入(Prompt injection)、有毒文档或受损工具——只需要在常规操作流中埋入一个有后果的操作。恶意的“删除备份”或“电汇资金”带着与之前四百个无害查询相同的对话框出现,并得到了同样的反射性点击。

这就是“点击穿透漏洞”(Clickthrough vulnerability),它颠覆了统一设卡(Uniform gating)背后的直觉。为了“安全起见,要求对所有事情进行审批”的本能,恰恰制造了导致危险审批溜掉的注意力不集中。更多的关卡可能意味着“更少”的安全性。从攻击者的角度来看,一个频繁触发的监督过程与根本没有监督是无法区分的——除了它还会产生一个虚假地证明人类查看过的审计日志。

监管机构已经开始为此命名。欧盟《AI 法案》第 14 条关于高风险系统的人类监督,明确要求部署者使操作员能够“意识到自动依赖或过度依赖”AI 输出的可能倾向——也就是文中点名的自动化偏见。法律现在要求你针对橡皮图章化进行设计,而不只是安排一个人并称之为已治理。

识破“表演式监督”的迹象

会员专享

余下内容仅对会员开放。

会员可读完整内容 —— 每一个公开发布的观点背后,那些框架、决策与推理的全貌。

  • 完整文章,包含未公开存档的部分
  • 可落地的工作框架,附带权衡与决策依据
  • 新文章抢先看,先于公开发布

随时取消 · 一次订阅,畅读全部

参考资料

保持联系,关注我获取更多内容

阅读需 10 分钟

智能体权限提示存在习惯化曲线,而你的安全叙事就建立在其斜率之上

权限提示是一种具有可衡量半衰期的安全控制手段。你应该跟踪每个用户的审批率,根据爆炸半径对摩擦力进行分层,并停止让 100% 的点击率作为你安全叙事的唯一支撑。

insider
ai-agents
阅读需 9 分钟

HITL 橡皮图章问题:为什么"人在回路"往往两者皆非

大多数人在回路的实现并没有产生监督效果——它们只是产生了文书工作。以下是审查者停止审查的原因,以及在规模化场景下保持HITL真实有效的设计模式。

insider
ai-safety
阅读需 9 分钟

当升级请求无人响应时:人机回环是一个人员配置问题

人机回环(Human-in-the-loop)的前提是有人响应升级请求。在生产环境中,这是一个包含到达率、服务时间和放弃率的队列——而无人响应的升级请求比没有升级请求更糟糕。

insider
ai-agents
阅读需 10 分钟

为自主 AI 智能体设计审批门禁

在关键时刻暂停 AI 智能体执行的工程模式 —— 涵盖动作风险分类、中断-检查点-恢复、异步审批工作流,以及防止静默漂移的断路器。

ai-agents
human-in-the-loop
阅读需 10 分钟

无人清理的审批队列

风险分层门控将危险的智能体操作路由到人工队列 —— 但一个没有负责人、没有 SLO 且没有超时策略的队列,只是另一种更慢的失败方式。本文探讨如何像管理真实的基础设施一样运营人工闸口。

insider
ai-agents