95% 可靠性幻觉:为什么你的 10 步 Agent 在 40% 的情况下会失败
一个在单步可靠性为 95% 的十步 Agent,其端到端成功率仅为 60%。验证部署、冗余模式和更短的链条是改变这一曲线的架构杠杆。
为什么 AI 生成的注释腐烂得比代码还快
AI 智能体为每个函数生成流利的文档字符串,它们往往只是在转述代码逻辑,而非编码意图。一旦代码发生变动,注释就会说谎——而下一位读者往往会相信谎言而非代码。这是一套面向 AI 辅助时代的代码审查规范。
AI 审查 AI:代码审查智能体的非对称架构
当作者和审查智能体共享同一个基础模型时,代码审查就变成了一种信心放大器,而非质量关卡。本文探讨如何通过非对称架构、多轮批评者(multi-pass critics)和评估纪律,将 AI 审查转化为真实有效的信号。
可申诉性差距:如何工程化设计用户真正可申诉的 AI 决策
生产环境中的 AI 智能体往往会在不经意间将退款拒绝、内容删除和验证驳回变成最终定论。在监管机构或愤怒的用户逼你动手之前,抢先构建持久记录、申诉端点以及真正的二次复审流水线。
双写竞态:当你的智能体与用户同时编辑同一个日历事件时
负责编辑日历、CRM 和工单的智能体,继承了一类其工具在设计之初从未考虑过的并发 Bug。修复方案是通过工具层传递版本令牌 (version tokens)。
你的 Span 名称是未记录的 API:Agent 团队之间的遥测契约
Span 名称和属性键是未记录的 API,其使用者涵盖了成本仪表板、评估流水线和 SLO 告警。请将遥测数据视为带版本的 Schema,否则你将不断因那些无声失败的破坏性变更而接到告警电话。
Agent 的策略即代码 (Policy-as-Code):OPA、Rego 以及你的工具循环中缺少的决策点
随着工具目录的增长,系统提示词和 YAML 配置清单将不再适用。在每个工具调用前设置一个专用的策略引擎——如使用 Rego 的 OPA 或 AWS Cedar——可以为 Agent 提供提示词工程无法提供的、可审计的策略决策点 (Policy Decision Point)。
确认与行动间的鸿沟:智能体的“明白了”并不等同于承诺
生产环境中的智能体经常自信地确认那些从未执行的操作,这是因为开发团队将对话文本误认为是契约,而非工具调用。本文介绍一种将叙述与承诺分离的设计模式。
Agent 回填问题:你的模型升级是对过去 90 天的一次审判
当一个更聪明的模型与你已经发布的模型产生分歧时,每一个持久化的 Agent 决策都会变成一个有争议的记录。这是一个关于评估、决策和动作重放的框架 —— 以及你在下次升级前需要的架构先决条件和策略矩阵。
智能体幂等性是一项编排契约,而非工具属性
当不可预测的规划器(Planner)可能重新发起相同动作时,仅靠工具层面的幂等键是不够的。该契约必须存在于编排边界,并以结构化的运行状态作为键 —— 而非由模型生成的参数作为键。
智能体记忆 Schema 演进:Protobuf 的困难模式
智能体记忆拥有两种 Schema —— 存储层和模型上下文 —— 而其中只有一种可以通过 SQL 脚本进行迁移。本文将探讨为什么 Protobuf 的“仅增量”准则是正确的起点,以及在此基础上影子写入方案还需要哪些补充。
静默成功:当你的 Agent 宣告完成但实际上什么也没发生
Agent 往往因为喋喋不休而失败。自信的文字掩盖了工具错误,而写入操作从未真正提交。解决方案是:将模型的声明降级为假设,将工具响应和操作后探测提升为权威信号,并衡量效果落地而非单次对话的成功。