你无法通过邮件给模型发送变更日志:为什么当调用者是 LLM 时,API 弃用机制会失效
LLM 调用者没有收件箱,没有稳定的身份,也没有义务阅读你的迁移指南。本文将探讨为什么沿用了 15 年的 API 弃用策略在 Agent 面前会失效,以及我们应该如何改进工具 Schema、错误信息和网关。
MCP 工具弃用:为什么模型仍然调用旧名称
重命名 MCP 工具不仅仅是 API 弃用 —— 这是一种模型分布的转变。本文将探讨为什么旧名称会持续出现,以及如何在不触发运维告警的情况下逐步淘汰它。
工具 Schema 演进陷阱:当一个可选参数改变了你 Planner 的先验分布
在现有工具描述中新增一个可选参数,发布过程顺利,没有破坏任何调用者,也没有导致评估失败 —— 但由于 Planner 的先验分布发生了偏移,它悄无声息地让工具调用频率增加了两位数。为什么工具 Schema 需要语义化版本(SemVer)、频率基准,以及与系统提示词(System Prompt)同样严格的评估规范。
当工具撒谎时:智能体默认信任的“伪成功”失败模式
工具调用返回成功,但底层操作从未实际执行——这是导致“模型对用户撒谎”事件背后的结构性失败模式,也是高风险智能体所需的校验层。
工具目录中的依赖炸弹:为什么增加一个工具会破坏五个智能体
在智能体的工具目录中添加新工具会重新分配规划器在每个条目上的选择概率,从而在静默中重定向那些你的评估套件从未想过要测试的工作流。
函数调用 vs 代码生成的智能体动作:无人基准测试的权衡
大多数智能体基准论文衡量函数选择准确性。真正在生产中重要的权衡——安全暴露面、调试成本、解析失败和不可逆性——几乎从未被比较。这是工程师需要的决策框架。
LLM 中的图推理缺陷:为那些令序列训练模型困惑的关系任务构建脚手架
基于序列训练的 LLM 在处理图结构推理任务时存在系统性失效。本文介绍了一种用于补偿的工程模式:结构化编码、基于工具的遍历,以及一个用于在编写第一个提示词之前,检测你是否正在挑战底层架构局限性的预构建诊断程序。
LLM 工具表面的契约测试:当供应商更改字段而你的智能体静默适应时
当供应商重命名工具响应字段时,你的智能体不会崩溃 —— 它会自行适应并交付一个质量下降的答案。为什么微服务契约测试必须迁移到智能体技术栈,以及如何进行配置。
确认与行动间的鸿沟:智能体的“明白了”并不等同于承诺
生产环境中的智能体经常自信地确认那些从未执行的操作,这是因为开发团队将对话文本误认为是契约,而非工具调用。本文介绍一种将叙述与承诺分离的设计模式。
工具幻觉率:你的智能体团队尚未运行的探测工具集
大多数智能体团队只测量工具调用的成功率,却从不测量工具幻觉。将该指标细分为三类——未知工具、影子调用和幻觉参数——并构建探测工具集,在生产环境出问题前捕捉这些错误。
幽灵工具调用:当AI智能体调用不存在的工具
LLM智能体有时会凭空捏造工具调用——调用不存在的函数,并配上看似合理的参数。本文解释为什么会发生这种情况、五种失败类别,以及在幽灵调用破坏工作流之前捕获它们的运行时防御模式。
工具爆炸问题:为什么你的智能体在 30 个工具时就会崩溃
随着工具数量增长,智能体的工具选择准确率从 96% 骤降至不到 15%。三种架构模式——Tool RAG、层级路由和 STRAP 整合模式——能让智能体在超过 30 个工具时依然保持可靠。