·tian
演示到生产的悬崖:为什么准确率 90% 的智能体发布率为 0%
每步成功率为 90% 的智能体是一个完美的演示,但却是一个无法发布的产品。这种差距不是打磨问题,而是高昂失败成本的长尾效应,而解决方案是降低这些失败的成本。
ai-agents
reliability
llmops
production-engineering
·tian
发布前的爆炸半径清单:你的智能体团队遗漏编写的文档
大多数智能体团队在第一次事故发生时才发现缺失了爆炸半径清单。本文将介绍这一交付物、它所需的列,以及如何将其设为 CI 合并门槛以确保其准确性。
insider
ai-agents
security
governance
+1·tian
确认与行动间的鸿沟:智能体的“明白了”并不等同于承诺
生产环境中的智能体经常自信地确认那些从未执行的操作,这是因为开发团队将对话文本误认为是契约,而非工具调用。本文介绍一种将叙述与承诺分离的设计模式。
insider
ai-agents
llm-evaluation
observability
+2·tian
数据回滚难题:如何撤销AI智能体写入生产环境的数据
当AI智能体以机器速度在分布式系统中写入生产数据时,传统数据库回滚机制就会失效。本文介绍使智能体写入状态可恢复所需的架构转变。
ai-agents
distributed-systems
data-reliability
production-engineering
·tian
智能体幂等性:为什么你的 AI Agent 会发送两次邮件
生产环境中的 AI Agent 会重试失败的工具调用——这会导致重复付款、重复邮件以及重复的现实世界操作。本文介绍了来自分布式系统的四种经受过实战检验的模式,让智能体副作用的重试变得安全可靠。
ai-agent
idempotency
distributed-systems
production-engineering