Agent 撤销按钮是 Saga,而非栈
多工具 Agent 撤销本质上是一个伪装的 Saga 模式问题。预计算逆操作、残留 UX 和级联限制决定了撤销是会成功,还是会在 40% 的情况下静默失败。
取消安全的智能体:你的“停止”按钮背后已经产生的副作用
“停止”只是一种 UI 手段,而非系统保证。这是一份针对取消安全智能体的从业者指南:持久化副作用账本、作用域授权、补偿操作,以及取消 UI 究竟应该显示什么。
重试放大:2% 的工具错误率如何演变成 20% 的智能体故障
智能体循环通过在多个步骤和 SDK 层级间叠加重试,将 2% 的工具错误率放大为 20% 的用户端故障。本文将解析其背后的数学原理、自我 DoS 模式,以及能够遏制这种现象的重试预算规范。
智能体集群并发:在没有死锁或惊群效应的情况下协调数十个智能体
LLM 智能体集群是一个小型分布式系统,而不是单个智能体的三十个副本。准入控制、AIMD 背压、熔断器和外部状态协调是防止并发集群自我崩溃的关键。
数据回滚难题:如何撤销AI智能体写入生产环境的数据
当AI智能体以机器速度在分布式系统中写入生产数据时,传统数据库回滚机制就会失效。本文介绍使智能体写入状态可恢复所需的架构转变。
AI智能体的CAP定理:当LLM成为瓶颈时,选择一致性还是可用性
当AI智能体的工具调用失败或LLM超时,你面临的权衡与分布式系统工程师从CAP定理中熟悉的如出一辙。大多数智能体框架默默选择了可用性——并在生产中为此付出代价。
LLM 流水线中,幂等性是必选项
当输出具有随机性时,传统的幂等性机制将失效。本文介绍了在生产级 LLM 系统中防止重复执行、成本爆炸和状态机损坏的架构重构思路。
并行智能体系统中的隐性数据损坏问题
当并行智能体写入共享状态时,竞态条件会产生看起来完全像模型错误的隐性数据损坏。本文介绍如何诊断并使用借鉴自分布式数据库的模式来修复它。
无共享智能体:为水平可扩展性设计 AI 智能体
大多数 AI 智能体无法水平扩展,因为它们积累了将其绑定到单一机器的隐式状态。本文介绍解决这一问题的架构规范。
级联问题:为什么 Agent 副作用在大规模运行时会呈爆炸式增长
独立通过每一项单元测试的 Agent 在大规模部署时会导致级联副作用。本文将介绍其工程分类以及真正能防止这种情况的模式。
跨 Agent 服务边界的分布式追踪:上下文传播的断裂
当 Agent 跨微服务边界调用 Agent 时,W3C TraceContext 会发生断裂,追踪信息碎片化为不相关的 Span。本文介绍故障的技术形态以及修复方法。
智能体工具调用中的幂等性问题
为什么智能体重试逻辑会导致重复扣款、重复发送邮件和状态不一致——以及如何通过Saga模式、幂等键和结构化错误信号从架构层面解决这一问题。