跳转到主要内容

站会在撒谎:当智能体集群整夜运行,如何协调工作

阅读需 1 分钟Tian PanTian Pan

“你昨天做了什么?”是每一场站会的第一个问题。对于一个通宵运行智能体集群(agent fleets)的团队来说,这已经变成了一个无法如实回答的问题。字面上的答案是:我写了三个提示词(prompts),然后回家睡觉,醒来发现有 11 个 PR,其中 4 个我还没看。那个正在陈述进展的人并不是故意撒谎。是这种仪式在替他们撒谎,因为它建立在一个不再成立的假设之上——即工作单元是一个人类在办公时间内串行地、一次只做一件事。

这个假设是起到承重墙作用的。它支撑着燃尽图、Sprint 承诺、速率值、“受阻 / 进行中 / 已完成”列,以及“谁在什么时候告诉谁什么”的整个协作流程。抽掉这个假设,这些产物并不会优雅降级。它们会继续产生看似权威但毫无意义的数字。一个团队可以拥有漂亮的燃尽图和绿色的 Sprint 状态,而其实际吞吐量有一半发生在午夜到凌晨 6 点之间,这些工作不归属于任何人,没人审计,也没有体现在任何仪式中。

这并不是在论证站会很糟糕、你应该取消它们。很多人都写过这类文章,通常是将其作为一种生产力上的炫耀(productivity flex)。更有趣的观点则更为狭窄且令人不安:协调产物——图表、看板、每日口头同步——编码了一种工作模型,而当模型出错时,这些产物并不会向你发出警告。它们只是在继续驱动决策的同时,悄无声息地停止描述现实。

串行人类假设已根植于一切

敏捷仪式是为特定的物理逻辑设计的。一名工程师领取一张工单(ticket),处理几个小时或几天,其进展大致是连续且可观察的。每日站会每 24 小时对这个连续过程进行一次采样,当底层工作以人类的速度进行时,这是一个合理的节奏。燃尽图将这些采样整合为一条线。速率则计算跨 Sprint 的平均线条。每一个工具都假设:相对于真相的变化速度,采样率是足够快的。

智能体集群破坏的是采样率,而不是工具的数学逻辑。一个开发者使用编排器并行运行多个编码智能体——每个都在独立的 worktree 中,每个都在钻研不同的任务——这不再是一个被每日采样的串行过程。他们是一个异步小分队的派遣员,这个小分队的状态在两次站会之间可能发生翻天覆地的变化。这种针对 backlog 运行智能体直到触发成功标准的“Ralph Wiggum”式循环,可以在一夜之间处理掉一打任务。当团队在 9:45 集合时,“昨天”既包含人类写的两小时提示词,也包含集群八小时的自主执行,而站会格式却只给两者留下了一个位置。

所以人们选择压缩。他们会说“我在做权限重构”,因为那是可理解的、人类规模的总结。而实际状态——五个智能体分支中三个已合并,一个被放弃,一个在等待不稳定的集成测试,以及人类还没看过的第六个任务——无法塞进这种口头轮流汇报中,所以也就没被说出来。站会捕获的细节并没有比以前少。它捕获的是一种完全不同的东西:人类的意图,而非系统的状态。过去这两者几乎是等同的。现在不再是了。

燃尽图变成了镜子,而非窗户

燃尽图的作用本应是一扇窗户:透过它看到剩余工作向零递减。随着智能体进入流程,它变成了一面镜子——它主要反映的是代码生成的(generation)速度(现在这几乎是免费的),而不是价值交付(delivery)的速度(这仍然是昂贵的部分)。

这正是那些关注吞吐量的领导者在 2026 年初开始大声疾呼的陷阱。当编码周期从几天压缩到几分钟,瓶颈就不再是打字速度,而是转移到了下游的一切:审计、验证、集成,以及判断生成的变更是否正确的裁决。燃尽图计算着廉价部分归零的过程并报告进度,而昂贵的部分——这能用吗、我们信任它吗、人类能否在不破坏生产环境的情况下合并它——则在图表之外隐形地堆积如山。

真正应该让你感到恐惧的是这个差距。在 2026 年的一项开发者调查中,96% 的开发者表示他们并不完全信任 AI 生成的代码在功能上是正确的,但只有 48% 的人总是在提交前进行验证。这意味着行业中有一半人在交付他们公开表示不信任的代码。而且,在落地两周内被重写的代码比例一直在攀升——这意味着那些漂亮的吞吐量中,有越来越大的一部分其实是穿着进度外衣的返工。一个将“智能体开启了 PR”视为“工作已燃尽”的燃尽图,是在整合噪音并将其称为信号。

解决方案并不是一个更好的图表。而是重新定义“剩余工作”,使其涵盖完整的生命周期——生成、评审、验证、合并、两周内未回滚——这样指标衡量的就是交付的价值,而不是生成的 Token。当智能体完成工作时,一个工作单元并没有结束;只有当一个人类接受了对该工作的责任时,它才算完成。这种“接受”而非“生成”,才是现在的稀缺资源,也是你的协调产物应该追踪的东西。

会员专享

余下内容仅对会员开放。

会员可读完整内容 —— 每一个公开发布的观点背后,那些框架、决策与推理的全貌。

  • 完整文章,包含未公开存档的部分
  • 可落地的工作框架,附带权衡与决策依据
  • 新文章抢先看,先于公开发布

随时取消 · 一次订阅,畅读全部

参考资料

保持联系,关注我获取更多内容

阅读需 11 分钟

晨间审查队列:如何分流处理 Agent 八小时无人值守的工作成果

通宵编程 Agent 交给你的不只是完成的代码,而是一个分流处理难题。本文将探讨信任层级、来源回执、批量决策以及双轮分流机制,如何防止晨间审查队列成为你团队最大的时间黑洞。

insider
ai-agents
阅读需 8 分钟

绩效评估衡量的是舰队,而不是工程师

PR 数量和速度现在衡量的是你对智能体的驾驭能力,而不是你的工程判断力。当 AI 编写了一半的代码变更时,绩效校准、评估指标和职业阶梯必须如何随之改变。

insider
ai-agents
阅读需 10 分钟

那些被 AI Agent 悄然终结的编程面试

编程 Agent 切断了 Take-home 任务衡量标准与实际工作需求之间的联系 —— 而大多数招聘流程仍在沿用这个已经失效的代理指标,却未曾察觉。

insider
hiring
阅读需 11 分钟

生产环境中的 Agentic Coding:SWE-bench 分数没有告诉你的真相

SWE-bench Verified 的评分已达到 80% —— 然而同样的模型在更难的基准测试中仅获得 23% 的分数,一项受控研究发现 AI 工具反而让经验丰富的开发者效率降低了 19%。本文将探讨编程智能体在何处真正交付价值,以及它们在何处悄然失败。

insider
ai-agents
阅读需 10 分钟

一次导致所有运行中 Agent 任务失效的 Prompt 热重载故障

在晚上 11:46 进行了一次正常的 Prompt 推送,一分钟后却出现了由于幻觉导致的退款 —— 深度解析为什么在 Agent 运行期间,Prompt 注册表需要将会话视为契约而非缓存。

insider
ai-agents