引入“人机回圈”(Human-in-the-loop),你就有了一个控制点。每天在这个人面前摆上一百个审批请求,你得到的只是一个戴着控制点徽章的“橡皮图章”。在架构图上,两者看起来一模一样。但在负载之下,它们的表现完全不同,而两者之间的鸿沟,正是大多数“负责任的 AI”部署默默宣告失败的地方。
任何观察过安全运营中心(SOC)陷入困境的人对这种模式都不陌生。行业调查显示,未被调查的警报比例在四分之一到三分之二之间——一个经常被引用的数字是,62% 的警报被直接忽略,55% 的团队承认经常错过被他们归类为关键的警报。分析师并不懒惰。他们每天处理数千个警报,而误报率通常超过 50%,人类大脑对这种比例的反应正是你所预期的:它不再关注了。智能体 AI(Agentic AI)正通过一个又一个确认对话框,重新制造这种完全相同的故障模式。
令人不安的是,审批疲劳并不是你可以通过优化 UX 就能解决的烦恼。它是认知经济学的一个可预测后果。当阅读每一项提案的成本超过了感知收益时——因为过去 100 项中有 95 项都是正常的——理性的操作员会通过略读、模式匹配,然后反射性地点击“批准”来进行优化。Google DeepMind 的研究人员在 2025 年将其列为命名的“AI 智能体陷阱”之一,它值得你用对待内存泄漏一样的严谨态度来设计防御措施。
为什么人类不再阅读
在人因工程学文献中,这种机制有一个名字:自动化偏见(Automation bias)。这是一种过度信任自动化系统而低估自身判断的倾向,在智能体出现之前的几十年里,航空和医学领域就已经对其进行了测量。
一项关于临床决策支持中自动化偏见的系统性综述发现,当临床医生面对自信且大多正确的机器建议时,在很大一部分时间内会接受错误建议——研究报告显示,接受错误 AI 建议的比例在 6-11% 之间,一项计算病理学实验显示,最初“正确”的人类判断有 7% 的概率被错误的 AI 建议推翻。关键在于,时间压力不一定会增加偏见发生的“频率”,但会增加其“严重程度”。航空界在另一个标签下讲述了同样的故事——自动化自满(Automation complacency),飞行员如此完全地信任自动驾驶,以至于他们停止扫描仪表,并失去了在故障发生时接管所需的态势感知。
三种力量共同导致了这种退化:
数量压倒了判断。 超过一定的吞吐量后,每个审核员都会从评估转向模式匹配。他们不再问“这正确吗?”,而是问“这看起来像之前正常的四十个吗?”
可靠性孕育了脱节。 你的智能体变得越好,每次审批得到的关注就越“少”——而罕见的糟糕提案就变得越危险,因为没有人准备好去捕捉它。
拒绝的代价是昂贵的。 如果说“不”意味着工作流停滞、提交理由或与被智能体自动化了工作的队友争论,那么阻力最小的路径就是说“是”。
请注意,这些问题都无法通过告诉人们“多加注意”来解决。注意力是被耗尽的资源。你无法通过劝诫来解决资源短缺问题。
当图章变成安全漏洞
橡皮图章化不仅是质量问题。它还是一个有记录的攻击面。
考虑一下审批流实际上在训练什么。如果每一个琐碎的、只读的操作——数据库查询、文件读取、状态检查——都需要确认,那么你就在进行成千上万次的重复训练,教会审核员一个道理:批准是安全的,批准是快速的。 你建立了一个条件反射。现在,一个能够影响智能体输出的攻击者——通过提示词注入(Prompt injection)、有毒文档或受损工具——只需要在常规操作流中埋入一个有后果的操作。恶意的“删除备份”或“电汇资金”带着与之前四百个无害查询相同的对话框出现,并得到了同样的反射性点击。
这就是“点击穿透漏洞”(Clickthrough vulnerability),它颠覆了统一设卡(Uniform gating)背后的直觉。为了“安全起见,要求对所有事情进行审批”的本能,恰恰制造了导致危险审批溜掉的注意力不集中。更多的关卡可能意味着“更少”的安全性。从攻击者的角度来看,一个频繁触发的监督过程与根本没有监督是无法区分的——除了它还会产生一个虚假地证明人类查看过的审计日志。
监管机构已经开始为此命名。欧盟《AI 法案》第 14 条关于高风险系统的人类监督,明确要求部署者使操作员能够“意识到自动依赖或过度依赖”AI 输出的可能倾向——也就是文中点名的自动化偏见。法律现在要求你针对橡皮图章化进行设计,而不只是安排一个人并称之为已治理。
识破“表演式监督”的迹象
在修复这个问题之前,你必须承认它的存在。这种失败之所以具有隐蔽性,正是因为仪表板始终显示绿色——审批正在通过,队列正在清空,审计日志不断填充。以下是表明控制权已形同虚设的信号:
审批延迟接近于零且非常均匀。 如果智能体提出建议与人类批准之间的时间间隔,无论操作多么复杂都固定为两秒,那么根本没人阅读。阅读时间应该随着决策内容的复杂程度而波动。
拒绝率几乎为零。 一个从未说“不”的关卡算不上关卡。应该有相当一部分比例的提议被退回;如果不是这样,要么是你的智能体完美无缺(这不可能),要么是你的审查员只是个中转站。
审查员无法复述他们批准的内容。 试着让操作员解释一个小时前他们签字同意的决策。如果他们解释不清楚,那么该审批就没有包含任何判断。
存在升级路径但从未使用。 许多文化在技术上允许审查员升级问题或中止流程,但随后又通过时间压力或政治手段在社交层面上阻碍这种行为。那个“红色按钮”只是画上去的。
审查员缺乏评估所需的专业知识。 这种情况还有一个演变较慢的版本:随着智能体吸收了日常工作,被分配去验证异常情况的人类从未建立起判断这些异常所需的基础知识。最终,你得到的是初级人员对他们从未有能力理解的工作进行“橡皮图章”式的审批——这种监督成了某种“货物崇拜”(cargo cult)。
如果你的部署符合上述两项或更多,那么你拥有的并不是人机回环(human-in-the-loop)。你拥有的是一个“人类形状的责任海绵”,其存在的意义只是为了替系统实际做出的决策承担指责。
设计真正有意义的关卡 解决方法有悖直觉:要让监督发挥作用,就要减少监督。注意力是一种预算。将其花在真正能造成伤害的决策上,停止在那些无关痛痒的决策上浪费它。
按“爆炸半径”(blast radius)而非复杂度分层。 针对操作失误可能造成的破坏程度设置关卡,而不是看它表面有多复杂。无论一个针对非敏感数据的只读查询多么精妙,它的风险都很低;而一笔不可撤销的删除或对外付款,即使只有一行代码,也是高风险的。据此对你的操作进行分级——大致上,可逆的低影响工作采用自主执行,中等风险采用异步审查,只有对具有重大后果且不可逆的操作才采用同步硬停止。目标是将一百次反射性的审批变成十次真正的审批。
明确定义“有限自主权”。 给智能体一个精确的安全操作区间——最高支出 $X,仅触达这些资源,保持在特定频率内——在此区间内它可以不经询问直接行动。边界本身就成了控制手段。你只需要仔细审查一次“策略”(policy),而不是去审查每一项落入该策略内、却从未被真正看过的行动。
批量处理连贯的工作单元。 审查单个原子化操作会剥离其上下文,并诱发模式匹配(pattern-matching)。审查一个完整的、有意义的变更——例如一次完整的迁移提案或一整套外联序列——能给人类提供真正可以推理的内容,而推理行为正是抵御“自动化偏见”(automation bias)的良药。
让机器捕捉机械性错误。 将人类的注意力留给判断。自动评估(evals)、类型检查、策略静态检查(policy linters)和模拟运行应当在人工介入前过滤掉机械性错误的提案,从而确保人工队列中仅包含真正需要人类决策的问题。
对监督本身进行监控。 跟踪审查延迟、拒绝率以及审查员随时间推移与智能体达成一致的比例。如果一个审查员的批准率正趋于 100% 且延迟正趋于零,那么他正在退化成一个“图章”——请将其作为一项运营指标展示出来,就像你会对上升的错误率报警一样。然后有目的地重新增加阻力:引入随机审计来重新检查已批准的行动,偶尔插入一些“应该被拒绝”的测试案例,并轮换审查员,以免因过度熟悉而导致懈怠。
核心思想是,有意义的监督需要真正的权力和真正的参与,而不仅仅是存在感。人类需要有权说“不”而不受惩罚,需要有上下文了解“为什么”要说不,并且工作量要足够低,使得说“不”依然是一个现实的选项。剥离这三者中的任何一个,你都会回到“橡皮图章”的老路。
坦诚面对“人机回环” “人机回环”(human-in-the-loop)这个词已经变成了一个心理安慰——就像有人说“签了这张表”时,心里非常清楚根本没人会读。它让团队在交付自主系统的同时,告诉自己和监管机构:人在掌控之中。而事实往往是无人掌控。人类在回环中的存在,就像走廊里的灭火器:技术上存在,极少被测试,并且被心照不宣地假设会在一场无人演练过的紧急情况中发挥作用。
构建值得信赖的智能体意味着将人类的注意力视为系统中最为稀缺且最宝贵的资源——因为它确实如此。你发送的每一个审批请求都是从一个有限的账户中提现,一个过度透支的系统最终得到的监督会比“诚实的自动化”更糟糕,因为它带有控制的假象,却无控制的实质。选择并不在于“人工监督”还是“完全自主”,而是在于“专为适应人类认知而设计的监督”还是“仅仅为了让审计日志好看而存在的监督”。
数一数你的审批关卡。如果你的审查员点击“同意”的速度快到根本不可能是在阅读,那么你并没有建立一道防线。你只是建立了一种成本极高的制造“合理推卸责任”的方式——而第一个对抗性输入,或者第一个真正糟糕的提案,终将让你付出代价。
会员专享
余下内容仅对会员开放。 会员可读完整内容 —— 每一个公开发布的观点背后,那些框架、决策与推理的全貌。
— 完整文章,包含未公开存档的部分 — 可落地的工作框架,附带权衡与决策依据 — 新文章抢先看,先于公开发布 登录以继续阅读→ 随时取消 · 一次订阅,畅读全部