跳转到主要内容

专业知识悬崖:AI 编码智能体为何在成熟代码库中失效

阅读需 1 分钟Tian PanTian Pan

2025 年的一项对照实验让有经验的开发者使用了 AI 编码工具,并测量他们是否变得更快。开发者们预测效率会提升 24%。研究结束后,他们报告自己大约快了 20%。而客观测量显示,他们实际上慢了 19%

这并不是一个关于 AI 过度炒作的故事。这是一个关于隐性知识的故事——那种存在于每个成熟代码库中、仅靠阅读代码无法恢复的、无文档记录的"为什么"。AI 智能体在全新系统中生产效率出奇地高,正是因为那里几乎没有隐性知识可以违反。它们在成熟代码库中退步,原因完全相同。

隐性知识在代码库中的真实含义

迈克尔·波兰尼的观察——"我们能知道的比我们能说出来的更多"——在软件工程中有着显而易见的应用。一位在她维护了三年的系统中工作的资深工程师,掌握着永远不会出现在任何文档中的知识:

  • 这个缓存层假设单写者语义(single-writer semantics)的不变量,这就是为什么模块中任何地方都没有比较并交换(compare-and-swap)锁(添加它们在语法上是"正确的",但会引入幽灵争用)。
  • auth 中间件被构建为三层而非两层的原因,这是 2022 年一次涉及跨会话边界令牌重放事件后的刻意决定。
  • 这个看似冗余的二级索引之所以存在,是因为 2021 年的一次 ORM 迁移损坏了主键空间,删除它会悄悄破坏三份季度报告。

这些事实都不会出现在代码注释中。它们存在于旧的 pull request 讨论串中、早已归档的 Slack 对话中、某人在 2022 年写下但从未从任何地方链接过的 Notion 页面中,以及当时在场的工程师脑海中。

当 AI 智能体读取这个代码库时,它看到的是模式。它看不到决策。它无法区分代码之所以如此结构是出于约束,还是出于偶然。它默认使用统计上最常见的解法——这在全新代码中通常是正确的,而在这里通常是错误的。

失败模式是系统性的,而非随机的

AI 编码智能体在成熟代码库中以可识别的方式失败。这些不是一次性的 bug,而是将统计模式匹配应用于具有隐式约束的代码库所产生的可预测后果。

能编译的约束违反。 AI 建议通常在语法上是正确的,能通过类型检查,却违反了一个从未被编码进类型系统的不变量——因为团队不知道他们需要这样做。代码上线了,不变量被打破了,失败模式在数月后的生产中才显现出来。

回退到常见模式的默认行为。 当面对一个不寻常的架构——一个围绕非显而易见约束构建的架构——AI 会默认使用其训练数据中最常见的等效模式。运行事件溯源系统的团队会发现 AI 建议引入了可变状态。有严格幂等性要求的团队会发现 AI 建议引入了副作用。

复制粘贴放大。 GitClear 对 2.11 亿行代码的分析发现,2024 年是 AI 辅助代码库中复制粘贴行首次超过重构行的一年。AI 智能体在不理解这些模式是刻意为之还是偶然形成的情况下,就对其进行复制。随着 AI 大规模复制,偶然性模式被奉为典范。

违反反直觉约束。 对约束代码生成的实证研究发现,与常见训练数据模式相匹配的约束能达到 99% 以上的合规率;而与常见模式相悖的约束失败率在 10% 到 100% 之间。像"始终在边界处验证用户输入"这样的约束很常见,AI 会遵循。而"永远不要在应用层验证,因为我们的负载均衡器已经过滤掉了无效输入"这样的约束很不寻常,AI 会违反它——因为它所见过的每一个训练样本都在应用层进行验证。

实际后果是:你无法通过添加更多注释或在针对单个建议的提示词中表达得更清楚来解决这个问题。问题是结构性的:支配约束相关决策的知识不在代码库中。

会员专享

余下内容仅对会员开放。

会员可读完整内容 —— 每一个公开发布的观点背后,那些框架、决策与推理的全貌。

  • 完整文章,包含未公开存档的部分
  • 可落地的工作框架,附带权衡与决策依据
  • 新文章抢先看,先于公开发布

随时取消 · 一次订阅,畅读全部

参考资料

保持联系,关注我获取更多内容

阅读需 9 分钟

CLAUDE.md 作为代码库 API:为什么你的 Agent 指令文件是你写过的最具杠杆效应的文档

一个结构良好的 CLAUDE.md 作为可执行规范塑造着每一次 AI 辅助提交——但自动生成或臃肿的指令文件会主动降低 agent 的性能。了解指令预算约束、厨房水槽综合症和上下文腐化等反模式,以及让你的 agent 指令文件保持承重作用的渐进式披露架构。

insider
ai-engineering
阅读需 8 分钟

后框架时代:用 API 客户端和 While 循环构建智能体

为什么 80% 的生产环境 AI 智能体只需要一个提示词、一个工具列表和一个 while 循环——以及框架复杂性如何成为它承诺消除的瓶颈。

ai-agents
llm
阅读需 10 分钟

黑板模式回归:1980 年代的 AI 如何处理多智能体协作

通过共享计划文件进行协作的智能体团队正在重新发现 20 世纪 70 年代的黑板架构 —— 但他们只重建了白板,却遗忘了让其发挥作用的调度器、置信度评分和层级结构。

insider
ai-agents
阅读需 9 分钟

你的智能体内存需要垃圾回收机制

持久化智能体内存默认会单调增长,因此过时的事实会污染之后检索它们的每一次运行。本文将探讨为什么仅靠 TTL 是不够的,以及过时评分、替代链、溯源和写入时门控如何将内存从简单的日志转变为一套生命周期管理系统。

insider
ai-agents
阅读需 9 分钟

你的内部框架是一种低资源语言

编程智能体可以写出完美的 React,却会对你公司内部的 ORM 产生幻觉。本文探讨了为什么内部框架表现得像低资源语言,如何衡量这种能力断层,以及何时应该让你的技术栈顺应模型的训练分布。

insider
ai-engineering