难撤销操作的工具分类学:每个风险类别设置一个审批关卡
二元化的工具审批在负载下会失效:如果一个简单的确认对话框既用于保存草稿又用于对外支付,必然会诱导用户养成不假思索点击确认的习惯。一套六级风险分类法可以解决这种混淆问题。
你的工具目录遵循幂律分布,而你却在针对长尾进行优化
生产环境中的工具使用遵循幂律分布,但大多数 Agent 框架都将工具目录视为扁平结构,并为此付出了代价:Token 膨胀、工具数量超过 100 个时的准确度崩塌,以及隐性的长尾回归。这是一份关于热/冷分区的实战指南。
工具组合提权:你的安全审查清理了节点,而非边缘
针对单个工具的安全审查清理了节点,但智能体运行的是轨迹。智能体工具目录的组合图是一个安全团队从未枚举过的权限集,而混淆代理攻击就存在于这些边缘之中。
工具边界处的推理模型税
推理模型在基准测试中获胜,但在工具选择步骤中却损失了延迟和质量。本文探讨了按步骤进行的混合路由模式、归因以及反模式。
你的工具描述是提示词,而非 API 文档
工具规范文本是模型在决定何时调用之前读取的提示词。请像对待提示词一样对待它——提供具体的用例、反面示例、同类工具辨析——而不是像对待 OpenAPI 文档那样。
工具清单的谎言:当你的 Agent 信任一个后端已不再遵循的 Schema 时
生产环境 Agent 中最危险的 Bug 不是那些会报错的,而是工具描述承诺了一个后端在两个 Sprint 前就重命名的字段,而模型却仍在按照一切未曾改变的样子进行推理。
工具 Schema 弃用:为什么你不能直接重命名参数
Agent 工具 schema 同时存在于两个地方 —— 运行时规范和模型的上下文内存。重命名参数会以不同的方式破坏这两者。这里是弃用指南。
串行工具调用瀑布:Agent循环中隐藏的延迟税
Agent框架默认串行执行工具调用,即使这些调用在逻辑上相互独立,造成与N+1查询问题如出一辙的延迟级联。本文介绍如何识别并修复这一问题。
工具过载问题:为什么工具越多,你的大模型越笨
当 LLM 面对大量工具集时,工具选择准确率会跌至 13%。本文解析工具过载如何拖垮你的 Agent,并介绍如何通过路由层、分层工具集和懒加载注册表来解决这一问题。
工具文档字符串考古学:描述字段是你杠杆率最高的提示词
工具定义看起来像 API 文档,但其本质是自然语言提示词。请将描述字段视为生产级别的提示词资产 —— 并添加相应的 Lint 规则来捕捉那些无声的回归风险。
Schema 熵:为什么你的工具定义正在生产环境中腐烂
生产环境 AI 系统中的工具定义在数月内会悄无声息地降级。本文将探讨 Schema 熵是如何形成的,为什么 Agent 无法自我修正,以及如何通过版本控制和契约测试实践在故障发生前捕获腐烂问题。
N+1 查询问题已经感染了你的 AI Agent
ORM 时代的 N+1 查询问题在 AI Agent 工具调用层重新出现 —— 顺序单项获取、冗余重新获取和过度获取正默默地增加你的延迟和 Token 成本。本文将介绍如何诊断并修复这一问题。