几乎每一次企业 AI 部署中都会出现同一种模式:工具在演示中表现出色,上线生产后却悄然止步于 70–80% 的潜力。团队将其归咎于模型质量、上下文窗口限制或检索失效。然而大多数情况下,这个诊断是错的。真正的问题在于:他们要求 AI 扮演一个它在结构上无法胜任的角色——至少目前如此,也许永远如此。
"AI 能完成这项任务"与"AI 能胜任这个角色"之间的鸿沟,是企业 AI 领域最昂贵的误解。
任务与角色是两回事
当一名团队成员离职,你将其工作交给 AI 工具时,你交出的不仅是一系列任务,而是一个职位——组织图谱中的一个节点,附带信任关系、权限边界、情境记忆和问责机制。任务是离散的,角色是持续的。
实习生可以转录会议记录、起草摘要、做竞品分析,但实习生无法批准合同例外、判断哪位副总裁需要介入某次敏感升级,也无法读出工程负责人那句"没问题"背后实际上意味着"六个月后我会抱怨这件事"。这些不是多读文件就能弥补的知识缺口,而是组织地位的缺口。
AI 工具面临同样的结构性局限——而几乎没有人为此做出设计。
以金融服务公司的升级路由为例。成文政策有 47 页,但真正的决策取决于:这笔交易是否针对一级关系客户、季度末是否在两周内、审查例外的风险官是否在休假。这些情境没有任何一条存在于知识库中,它们分散在 Slack 消息、日历状态以及在场足够久、见过这种模式重复出现的人的记忆里。
AI 工具可以读完那 47 页政策,标记出需要例外审批。但它无法判断:正确的做法是在工单进入正式队列之前,先致电风险官的副手。
三大结构性鸿沟
企业工作流在 AI 交接处失败,有三个反复出现的原因:权威、周期和判断。
权威 是最容易理解、也最难事后修补的。组织通过正式权威(谁有签字权)和非正式权威(谁的意见实际上决定结果)的组合来做出决策。AI 系统只能访问正式层,几乎完全缺失非正式层。当 AI 智能体提出建议时,它无法强制达成共识、疏导阻力,也无法做出那个让交易重新启动的策略性让步。它能产出结果,但无法施加影响。
升级问题让这一点更加复杂。人类凭直觉解决的模糊性——这是例行例外还是深层问题的信号?——一旦通过 AI 系统路由,就会产生大量升级。在没有重新设计升级架构的情况下部署智能体的组织,最终往往需要更多人工审核时间,而非更少。
周期 是随任务复杂度线性扩大的能力鸿沟。长周期任务要求在数十乃至数百个步骤中保持连贯的意图,往往横跨数日乃至数周的实际时间。当前 AI 系统的上下文窗口在营销材料中听起来令人印象深刻——数百万 token——但企业代码库动辄横跨数千万 token,一个 20 人团队一年的 Slack 消息量远超任何上下文窗口所能容纳的范围。
更根本的是,上下文窗口不是记忆。会话结束,模型便遗忘一切。"迷失在中间"效应意味着,即便在单次会话内,当相关信息埋藏在长上下文的中部而非首尾时,性能也会显著下降。一个已运行六个月、伴随着需求演变、人员更替和积累决策的项目,对于只能看到当前窗口内容的 AI 而言,几乎是不可见的。
结论是:AI 在技术娴熟的人类能在单次专注会话内完成的任务上表现出色。随着周期延伸,性能急剧下降——且这种下降不是线性的。错误复利意味着一个 50 步工作流的第 3 步出现的错误,会悄然污染其后的所有环节。
判断 是最难量化、却在组织层面最具决定性意义的鸿沟。企业中的判断不仅仅是独立做出正确决策,更是做出顾及社会织物的决策:谁需要在这个决策中感到被倾听,即便他们没有正式权威?无论组织架构图如何,这个团队中真正的技术决策者是谁?何时邮件的语气比内容更重要?
这种人际校准不存在于任何系统记录中,它存在于在特定组织与特定人共事多年所积累的模式识别中。用通用企业文本训练的 AI 工具,没有获取这种能力的机制。
为什么"AI 即神谕"会让情况更糟
将 AI 视为神谕而非有特定有效范围的工具,是将可管理的局限变为代价高昂的灾难的失败模式。
当团队将 AI 建模为神谕时,他们会构建工作流,将所有模糊情境路由给 AI 来解决,而不是在适当的升级节点将其路由回人类。AI 的自信输出会压制"我们是否真的应该升级这个问题?"这一疑问。自动化偏见——在没有批判性审视的情况下接受机器生成建议的倾向——有充分的文献记录,当 AI 的输出流畅而权威时尤为突出。
实际后果是:团队构建了工作流,在其中 AI 被结构性地置于需要做出它并不擅长的决策的位置。这些决策看起来正确,直到出了问题——而那时积累的代价,远高于如果在第 2 步而非第 47 步就将决策交还给人类所带来的成本。
"初级员工"的心智模型更为诚实,也能带来更好的部署决策。一位知道自己擅长什么、遇到模糊情况会举手示意、权限之外的事项会向上汇报、且在入职第一个月绝不会被要求代表公司出席敏感谈判的初级员工,比一个过度自信、默默做出权限之外决策的人更有价值。围绕这一模型构建的工作流内置了检查节点,在适当间隔验证输出,并将组织判断路由回有资格行使它的人类。
良好的工作流分解是什么样的 答案不是"减少 AI",而是更好的路由——一种将工作流的每个组成部分与执行者(无论是谁还是什么)的能力图谱相匹配的分解纪律。
有效的分解从两个维度对工作流中的每个步骤进行分类:成功标准的明确程度,以及正确执行所需的组织情境量。标准明确、情境轻量的步骤是 AI 的强项。需要组织判断、权威或长周期连续性的步骤则应由人类承担——至少在 AI 工具跟上之前如此,对于权威维度或许是永久如此。
这种分类不是一次性练习。随着工作流积累历史——AI 建立起记录,人类对其特定失败模式形成经过校准的信任——一些步骤可以进一步交给自动化。但分解应始终是明确的,而非假设的。
三种在生产中有效的实践模式:
有界任务执行加人工检查点。 AI 处理文档分析、草稿生成、数据汇总等自成一体的步骤。人类在定义好的检查节点审查输出,然后才执行需要权限的操作。检查点不是可选项——它是工作流中的硬性门控,而非建议。
带明确触发器的例外升级。 与其让 AI 判断某事是否属于例外,不如算法化地定义触发器。如果交易规模超过 X,无论 AI 的置信度如何,一律升级。如果政策匹配分数低于 Y,路由至人工审核。这将判断权从 AI 手中移走,放到它应该在的地方:系统设计。
有时间边界的上下文注入。 对于较长周期的工作,构建机制将相关历史上下文显式注入 AI 会话,而不是希望模型自己弄清楚什么是相关的。每周一份"上下文简报"——由人类策划的相关决策、人员变动和演变约束摘要——给 AI 提供有用的组织记忆切片,而无需从头重建六个月的历史。
这些模式没有一个在技术上是复杂的。它们是组织设计选择。部署 AI 最有效的团队,不是拥有最好模型或最复杂检索系统的团队——而是那些对 AI 的能与不能保持诚实,并据此构建交接的团队。
永久实习生问题是特性,不是缺陷 "永久实习生"的框架听起来可能令人沮丧,但其实不然。实习生确实有用。一个清楚知道自己擅长什么、适时升级、从不越权的优秀实习生,比一个过度自信、默默在权限之外做决策的人更有价值。
大多数企业 AI 部署的问题,不在于 AI 太像实习生,而在于团队设计工作流时,仿佛 AI 拥有三年的组织情境、有权代表公司做出承诺、以及对本次会话之前发生的一切拥有完美记忆。这些假设是错误的,建立在错误假设之上的工作流,会以难以诊断的方式失败。
修正在原则上很直接,尽管执行并不总是如此:为 AI 实际是什么而设计,而不是为演示所暗示的样子而设计。将标准明确、情境轻量的任务路由给自动化。为需要权限的决策构建明确的升级触发器。为较长周期的工作投资上下文注入机制。并在 AI 在你的特定环境中积累记录时,定期审查分解方案。
AI 能力与 AI 组织角色之间的鸿沟会随时间缩小。上下文窗口会增长,长周期任务性能会改善,某些形式的组织权威最终可能在适当治理下委托给 AI 系统。但那些等待这些改进才开始审慎部署的团队,正在输给那些已经用今天存在的 AI 构建出有效混合工作流的团队。
为实习生设计。这不是上限——而是起点。
会员专享
余下内容仅对会员开放。 会员可读完整内容 —— 每一个公开发布的观点背后,那些框架、决策与推理的全貌。
— 完整文章,包含未公开存档的部分 — 可落地的工作框架,附带权衡与决策依据 — 新文章抢先看,先于公开发布 登录以继续阅读→ 随时取消 · 一次订阅,畅读全部