AI Agent 的 SRE:凌晨 3 点到底什么会出故障
传统的 SRE 运行手册无法涵盖 AI Agent 的失效模式。本文将探讨在生产环境中实际会发生的故障——死循环、上下文溢出、幻觉导致的 API 调用——以及如何通过监控、报警和成本控制来帮助值班工程师有效应对。
集成你不拥有的系统:第三方 AI 模型 API 集成实战手册
依赖外部模型 API,意味着限流、行为漂移和成本冲击都由你来承担。本文介绍一套能够应对提供商变更、服务中断和静默模型更新的系统架构。
结构化输出并非已解决的问题:生产环境中的 JSON 模式失效模式
JSON 模式看起来像是一个已经解决的问题,直到你遇到深度嵌套的 schema、包含大量枚举的类型,或者是静默截断的长补全。本文提供了一份完整的故障分类指南,以及在错误影响用户之前捕获故障的验证模式。
1% 错误率,1000 万用户:规模化 AI 故障的数学逻辑
为什么在离线评估中看起来正常的准确率指标,在生产规模下会变成灾难;如何为考虑尾部行为的 AI 功能设置 SLO;以及当模型已经足够好,但每月仍有数百万次错误时,该如何做出产品决策。
AI 驱动型 API 的行为 SLA:为非确定性输出编写协议
当你的 API 封装了 LLM 时,传统的 SLA 就会失效。学习如何定义行为协议 —— 包括格式保证、拒绝率、延迟 p95、幻觉预算 —— 以及如何在不破坏用户体验的情况下,对行为变更进行版本管理和沟通。
置信度-准确率倒置:为什么大语言模型在听起来最确信的地方往往最容易出错
前沿大语言模型在用户最信任的领域表现出最差的校准性。本文介绍如何量化这一问题,并构建能在真实损害发生前处理过度自信错误答案的系统。
演示到生产的失败模式:为什么AI原型在真实用户到来时会崩溃
演示使用精心挑选的输入、预热缓存和有耐心的评估者。生产环境面对的是对抗性查询、分布偏移的请求以及8秒内就会放弃的用户。以下是缩小差距的预发布方法论。
赢得自主权:如何让 AI Agent 从受监督过渡到独立运行
一种基于实测性能历史数据逐步扩大 AI Agent 操作范围的框架,包含回滚触发机制和监管机制,以防止过早赋予自主权。
事件驱动的 Agent 调度:为什么 Cron + REST 调用无法胜任循环 AI 工作负载
Cron 是为运维脚本而生的,而非自主 Agent。本文剖析将其用于循环 LLM 任务时的失效场景,以及真正可行的消息队列架构。
反馈循环陷阱:为什么当用户产生适应性行为时 AI 功能会退化
自诱导分布偏移是生产环境中 AI 功能的隐形杀手。当用户根据你 AI 的输出调整其行为时,在这些被调整后的数据上进行重新训练反而会使问题恶化。本文将探讨如何检测、衡量并打破这一循环。
指令复杂度悬崖:为什么大语言模型能可靠遵循 5 条规则却无法遵循 15 条
前沿模型能够可靠地同时满足约 3 个叠加约束,但会遗忘埋藏在长提示词中间的规则。本文将展示关于指令遵循能力退化的实证数据,以及在大规模应用中保持系统提示词可靠性的设计模式。
知识切断是一个隐形的生产环境 Bug
模型的训练知识切断点不仅仅是文档中的一个脚注 —— 它是一种传统监控无法察觉的延时生产故障。本文将介绍如何检测、遏制并围绕它进行设计。