具有两种延迟的 AI 功能:你衡量的是一种,用户感知的是另一种
流式 AI 功能具有两种分化的延迟 —— 首字时间 (TTFT) 和完成时间 —— 而大多数团队只测量了用户感知最不明显的那一个。本文将介绍如何拆分指标和 SLO。
升级率:离线测试遗漏的评估信号
升级率是衡量智能体能力的少数真实信号之一,但在大多数公司中,它存在于运营团队的人员配置仪表板上,而不是 AI 团队的评估审查中。以下是缩小这一差距的方法。
备用方案变成了默认方案:为什么你的分层配比需要 SLO
你的备用路径本应只处理 0.5% 的请求。现在它却承载了 38% 的流量。修复方案是将分层配比视为一等 SLO。
SLA 的幻象:为什么 99.9% 的可用性对 AI 功能毫无意义
传统的可用性 SLA 仅保证端点有响应,而不保证响应质量。本文将探讨为什么 AI 驱动的功能需要一种不同的可靠性契约。
当你的智能体具有自愈能力时,MTBF 已死
自愈智能体运行时已经吞噬了 MTBF 最初旨在统计的故障信号。以下是取代它的指标集:恢复后成功率、单次成功恢复成本以及单次追踪的恢复尝试分布。
Agent 降级模式规范是你没有撰写的文档
大多数生产环境中的 Agent 都有降级模式规范——它只是散布在零散的 catch 代码块中,从未经过测试,而客户会在下一个糟糕的日子里为你写下它的公开版本。
跨团队 Agent SLA 无法简单叠加:你的组织遗漏预算的 99% 数学陷阱
当 Agent 跨越团队边界互相调用时,单个 SLO 将不再能预测端到端的行为。在组合数学耗尽你的可靠性预算之前,必须落地的四个关键要素。
你的审核队列是自主权承诺消亡之地
人机协同 (Human-in-the-loop) AI 正在悄无声息地失效:审核队列不断膨胀,延迟缓慢攀升,安全叙事正逐一崩塌。这是一份针对 AI 功能的 SLO、容量陷阱和分层审核的实战指南。
Agent 延迟预算是树而非线 —— 你一直在错误的维度进行调试
Agent 延迟是由规划调用、工具扇出和子 Agent 组成的嵌套树 —— 按耗时排序的火焰图掩盖了关键路径,导致局部优化错失了真正的预算超限点。本文将介绍如何以树状思维进行预算分配、截止时间传递以及观测余量。
1% 错误率,1000 万用户:规模化 AI 故障的数学逻辑
为什么在离线评估中看起来正常的准确率指标,在生产规模下会变成灾难;如何为考虑尾部行为的 AI 功能设置 SLO;以及当模型已经足够好,但每月仍有数百万次错误时,该如何做出产品决策。
Agent 链中的截止时间传播:第三跳时你的 p95 SLO 发生了什么
用户可见的延迟约束在穿越多步 agent 管道时悄然消失。本文剖析这一结构性问题,分析主流框架的处理方式(并不理想),以及能真正解决问题的截止时间传播模式。
AI 功能的延迟预算:当核心组件是随机的,如何制定并达成 p95 SLO
LLM 延迟与数据库延迟的行为截然不同。本文介绍如何为 AI 功能制定切实可行的 p95 SLO、分解延迟预算,并利用对冲、流式传输和推测执行真正达成这些目标。