幂等性危机:LLM 智能体作为事件流消费者
至少一次投递假设重新处理同一事件会产生相同结果,但 LLM 不会。本文是关于幂等性键、去重窗口以及 AI 驱动的 Kafka 消费者补偿读模型的实践指南。
Agent 链中的截止时间传播:第三跳时你的 p95 SLO 发生了什么
用户可见的延迟约束在穿越多步 agent 管道时悄然消失。本文剖析这一结构性问题,分析主流框架的处理方式(并不理想),以及能真正解决问题的截止时间传播模式。
LLM 速率限制是一个分布式系统问题
LLM API 速率限制的行为类似于分布式锁 —— 批处理作业通过饥饿、队头阻塞和优先级反转,静默地使面向用户的流程陷入饥饿,而此时你的错误仪表盘依然显示正常。
多区域 LLM 服务:没人警告过你的缓存局部性问题
在不同区域部署 LLM 推理会产生无状态 HTTP 服务所没有的一致性和延迟问题。本文将介绍一种既能解决这些问题,又不会让你的运维负担增加三倍的路由架构。
多用户共享 AI 会话:尚无人解决的并发难题
当多个用户同时共享单个 AI 上下文时,标准的分布式系统假设就会失效。本文将探讨为什么多用户 AI 会话在架构上难以实现,以及生产团队为了解决这一问题所构建的方案。
当你的 AI Agent 从 Kafka 消费数据时:那些失效的设计假设
在消息队列上运行 AI Agent 会打破队列语义中固有的假设。本文将探讨当消费者具有随机性时,幂等性、顺序性和背压机制如何发生变化。
多用户共享智能体状态:你真正需要的并发原语
大多数智能体设计假设每个会话只有一个用户。共享工作区需要分布式系统原语,以防止并发用户发出相互矛盾的指令时发生无声数据损坏。
主动型 Agent:后台 AI 的事件驱动与定时自动化
绝大多数 Agent 设计文章都假设由人类触发执行。而生产环境中的 AI 越来越多地在后台运行——基于定时调度、变更事件和系统状态转换。这在架构层面改变了什么?
智能体系统中的写放大:为什么一次工具调用会命中六个数据库
智能体的一次记忆操作会同时触发对六个存储系统的写入。当第五个写入失败时会发生什么——以及来自数据库内部的预防模式。
异步 Agent 的静默失败:为何你的 AI 任务悄然终止却无人察觉
异步 AI 任务会静默而自信地失败——HTTP 200,仪表盘一片绿,客户最终投诉才发现。本文介绍死信队列、幂等键和 Saga 日志如何从传统分布式系统迁移到 AI Agent 场景以解决这一问题。
零停机 AI 部署:这是一个分布式系统问题
大多数团队将 Prompt 更新视为配置更改。事实并非如此 —— 它们是具有四个独立迁移面的生产部署。这里有一个分布式系统框架,可以在模型升级、Prompt 迭代和工具 Schema 更改期间保持 AI 系统的可靠性。
AI Agent 的 CAP 定理:为何你的 Agent 在本该优雅降级时却彻底崩溃
大多数 AI Agent 在单个工具宕机时会彻底崩溃——这与分布式数据库几十年前已解决的一致性与可用性权衡如出一辙。本文探讨如何设计部分可用路径。