跳转到主要内容

把每个工具都当作 O(1) 的规划器

阅读需 1 分钟Tian PanTian Pan

你的规划器输出了五次工具调用。从纸面上看,这是一个干净的解决方案:lookup_usersearch_documentscall_external_apispawn_sub_agentrequest_human_approval。轨迹优雅、逻辑自洽,智能体最终也会给出正确答案。可在生产环境中,这五个步骤分别耗时 12 毫秒、800 毫秒、4 秒、2 分钟和 6 小时。规划器从未察觉,它这五步计划在成本上跨越了九个数量级。

这并不是幻觉。模型选对了工具,顺序也合理。它做不到的——工具模式根本没给它做这件事的途径——是去推理:计划的最后一步在性质上和第一步完全不同。在规划器眼里,工具就是工具,计划图中每个节点的权重都是 1。

结构性的失败在于:规划模型在推理工具序列时,就像程序员推理伪代码一样——每一步都被视作"一个工作单元"。只要序列在逻辑上有效,计划就被认为是正确的。至于这个序列是否"负担得起",规划器根本不知道该问,因为它看到的输入——工具目录——是一种被剥去价签的词汇表。函数签名暴露了类型,却没有暴露延迟层级、金钱成本、影响半径,也没有暴露这一步是否会让工作流挂起等待人类。

不同工具属于完全不同的成本量级

感受这道鸿沟最直接的方式,是按照规划器可能输出的顺序,把常见智能体工具的实际延迟下限列出来:

  • 内存查找或缓存命中:亚毫秒级。
  • 针对索引键的本地数据库查询:数十毫秒。
  • 中等规模语料上的向量搜索或全文搜索:数百毫秒。
  • 调用第三方服务的外部 HTTP API:几秒,长尾可达几十秒。
  • 调用一个本身会运行多步计划的子智能体:数十秒到数分钟。
  • 需要人工审批的工作流:无界,仅由 SLA 兜底。

其中最便宜与最昂贵之间的比例大约是九个数量级。把这些层级混在同一个步骤图里的计划,根本无从"优化",因为计划层级的成本由其中最差的那一层主导。一个由四个亚毫秒工具加一个人工审批步骤组成的计划,其尾延迟就等于那一步人工审批。其余四步在成本意义上是"免费"的。

而规划模型完全得不到这些信息。当它读取工具目录时,每个条目看起来都是一段 JSON Schema 片段——namedescription、参数列表。模型靠把描述与意图匹配来选工具。标准模式里没有"这次调用通常要 4 秒"这种字段,也没有"这次调用可能挂起数小时"这种字段。智能体的词汇表是一个扁平的命名空间。

智能体计划里的"成本"到底意味着什么

团队第一次遇到这个问题时,往往会去看 token 成本。Token 容易测量、容易计费、容易在仪表盘上呈现。但 token 成本是错的框架,因为智能体计划中最昂贵的部分往往是消耗零 token 的部分——为等一笔付款人工审核而挂起的工作流、为等下游批处理完成而进行的长轮询、为应对不稳定外部供应商而陷入的重试循环。

更诚实的智能体成本分解至少要有四个维度:

  • 延迟:调用返回所需时间,包括 p99 长尾。这是终端用户能感知到的部分。
  • 金钱:这次调用本身的美元成本,包括下游 API 费用、算力,以及为推理这次调用所花的 token。
  • 影响半径:这次调用对世界造成了哪些不可逆变化。一次退款比一次读取昂贵得多。
  • 可逆性:如果计划被证明是错的,这次调用能否撤销。可以回滚的数据库写入比一封发出去就收不回来的邮件便宜。
会员专享

余下内容仅对会员开放。

会员可读完整内容 —— 每一个公开发布的观点背后,那些框架、决策与推理的全貌。

  • 完整文章,包含未公开存档的部分
  • 可落地的工作框架,附带权衡与决策依据
  • 新文章抢先看,先于公开发布

随时取消 · 一次订阅,畅读全部

参考资料

保持联系,关注我获取更多内容

阅读需 10 分钟

工具边界处的推理模型税

推理模型在基准测试中获胜,但在工具选择步骤中却损失了延迟和质量。本文探讨了按步骤进行的混合路由模式、归因以及反模式。

insider
ai-agents
阅读需 9 分钟

没人使用的长尾:工具带是如何变得尾大不掉的

你给智能体增加的每一个工具,都在削弱它选择正确工具的能力。那几十个无人问津的工具正在悄悄降低那三个核心工具的被选概率 —— 本文将探讨如何保持工具目录的精简与高效。

insider
ai-agents
阅读需 10 分钟

无法说出"等一下"的智能体

生产环境中的智能体可以执行动作、给出答案或提出问题——但说不出"等一下"。缺失的原语如何把犹豫挤压成无谓的工具调用和过度自信的承诺,以及如何把审议重新纳入协议。

insider
ai-agents
阅读需 9 分钟

填充式工具调用:当智能体在表演勤奋而不是真正干活

生产环境中的智能体不断发出对答案毫无影响的工具调用——烧掉 token、拖慢延迟、损害准确率。本文讲清楚填充式调用是如何从训练中长出来的、它真正的成本是多少,以及如何用反事实测量和调用预算把它从工作流里剔除出去。

insider
ai-agents
阅读需 10 分钟

那个本该计算却随口编造数字的智能体

LLM 智能体往往会随口说出一个看似合理的数字,而不是去进行计算,流畅的文字掩盖了缺失的工具调用。本文探讨如何强制使用工具并为每一个数据附上出处。

insider
ai-agents