LLM Agent 中的并行工具调用:你可能尚未意识到的耦合测试
在 LLM Agent 中启用并行工具执行会暴露工具设计中隐藏的耦合问题 —— 本文探讨了三种静默失败模式、如何为安全并行对工具进行分类,以及何时应该合并工具而非并行化。
自我修改代理的边界:当你的 AI 能够重写自己的代码
自我修改 AI 代理——能够重写自身源码以提高基准测试表现的系统——已经从研究好奇阶段跨越到了可重现的结果阶段。本文将探讨这些基准测试数据背后的真实含义、论文中隐藏的失效模式,以及在生产环境中部署此类系统前你所需的治理基础设施。
当通用型 Agent 击败专家组:统一单 Agent 架构的优势
对于大多数生产环境中的 AI 任务,拥有丰富工具访问权限的单个强大 Agent 的表现优于多 Agent 流水线 —— 相关研究解释了为什么协同开销、错误放大和能力饱和使得专业化在规模化应用中成为一种负担。
生产环境中的智能体授权:为什么你的 AI 智能体不应该是一个服务账号
给 AI 智能体分配服务账号凭证是发现你的系统漏洞的最快路径——一旦出错,你很快就会知道它们能触达哪些系统。本文探讨了环境授权(ambient authority)、过度授权和冒充令牌如何导致生产事故,以及四种可以正确限制智能体权限的模式。
智能体规划模块:隐藏的架构缝隙
在 LLM 智能体中将任务拆解与执行分离,是大多数团队都会忽略的架构决策——直到他们的智能体在面对超过五个步骤的任务时开始崩溃。
AI 流水线中的结构化并发:为什么 asyncio.gather() 还不够
并行工具调用是 LLM 最强大的功能之一——但 asyncio.gather() 会引入孤儿任务、静默失败和资源泄漏,这些问题往往在生产环境高负载下才会暴露。本文将介绍如何在智能体流水线中正确处理并发。
智能体系统的补偿事务与故障恢复
AI 智能体在工作流执行中可能会失败。本文将介绍如何应用 Saga 模式、幂等键和持久化检查点,从而使不可逆的工具调用(如发送邮件、扣费、删除数据)在无需人工干预的情况下实现恢复。
异步智能体工作流:长运行任务设计
跨越 30 秒 HTTP 墙:针对运行数分钟或数小时的 AI 智能体,探讨异步作业队列、幂等键、检查点恢复模式以及轮询与 Webhook 的对比。
Agent Harness 深度解析
深入剖析使 AI Agent 在生产环境中保持可靠的基础设施层 —— 包括执行循环、上下文管理、错误处理、安全护栏以及状态持久化,这些正是区分原型与上线系统的核心要素。
从第一性原理设计智能体运行时
生产级智能体运行时并非简单的函数运行器 —— 它是一个执行基板。本文将从第一性原理出发,涵盖图执行模型、检查点、人机回环以及可观测性,教你如何正确设计一个智能体运行时。
为什么多智能体 AI 架构总是失败(以及你应该构建什么)
多智能体 AI 系统在生产环境中的失败率高达 41–87%。本文将探讨为什么并行智能体会导致错误累积、上下文碎片化以及难以调试,并介绍真正有效的更简单架构。