你的 Agent 链路中无人分配的延迟预算
Agent 的 SLO 通常设置在边界处,而内部却缺乏预算分配,导致没人能归因是哪一跳搞砸了 P99。你需要分配逐跳预算,在 Span 级别进行追踪,并约束那个呈乘性而非加性增长的尾部延迟。
Agent 的演练日:排演那些无法复现的故障
混沌工程假设故障是可重现的;但 Agent 系统的故障往往通过从不重复的随机路径发生。演练日(Game days)——包括工具故障注入、模型降级演练、上下文污染场景以及升级反馈消防演练——能建立运维人员的肌肉记忆,并暴露重现测试永远无法发现的追踪工具缺陷。
让 Agent 先接警:AI 故障响应的信任阶梯
故障发生的最初 15 分钟通常是机械化的,Agent 可以在你解锁笔记本电脑前就完成这些工作。这套由叙述者、建议者、受控执行者、受限自动修复者组成的四层信任阶梯,配合基于证据的晋升和有范围的降级机制,比在经历一个糟糕的夜晚后彻底禁用自动化要明智得多。
思维的 p99:当模型决定你的请求耗时多久
推理模型使响应时间成为问题难度的函数,导致 p99 延迟激增至 p50 的 3-5 倍,超时调整也演变为成本问题。通过针对更小模型的对冲请求、按路由设置的推理开销上限以及感知难度的 SLO,可以将尾部延迟控制在合理范围内。
理解债:没人能看懂的凌晨两点系统
AI Agent 交付了人类从未建模过的整洁代码,而账单却会在凌晨两点的故障处理中如期而至。本文将探讨为什么“理解债”是 Agent 时代的核心运维风险,以及如何保持人类理解与系统同步。
那些被静音的 LLM 报警:当每一次值班看起来都和上一个一模一样
当看起来完全相同的报警不断出现却无法触发任何后续行动时,LLM 功能的告警疲劳便悄然而至。随之而来的静音规则虽然是理性的适应行为,却最终破坏了生产环境的检测机制。
重试预算如何从你的仪表板中隐藏了供应商的真实错误率
一个在悄无声息间实现 99.9% 成功率 SLO 的同时导致账单翻了 3 倍的重试循环 —— 为什么重试后的可用性是向领导层报告的错误指标,你应该衡量什么,以及隐藏在可靠性层中的成本-质量调节开关。
你的故障指挥官无法执行的智能体运行手册
大多数智能体运行手册在白天读起来很顺畅,但在凌晨 2:17 运行时却会被阻塞,因为作者拥有值班 SRE 所不具备的访问权限。联邦化、声明式范围、紧急访问端点和演练才是解决之道。
你的智能体平台忘了配置的值班轮换
一个四人的 AI 平台团队为一个拥有 200 名日活用户的内部智能体上线,却忘了配置值班轮换 —— 最终以惨痛的代价学习了 SRE 人员配置的计算方法。
供应商配额在你的全球流量从未选中的时区重置
供应商配额按照供应商的时间重置,而不是客户的时间。当周期的临界结束点与你的流量峰值时区重叠时,429 错误看起来就像是随机噪声 —— 而 UTC 仪表板掩盖了背后的真相。
你的仪表盘以三种不同方式统计了那次重试
一个智能体在成功前重试了三次。产品团队看到了转化,SRE 团队看到了 75% 的错误率,财务团队看到了四次计费推理。通过任务结果、步骤健康度和预算消耗这三个层面,在保持数据一致性的同时,无需强求一个指标满足所有人的需求。
你的后端基础设施并非为流式响应而设计
流式传输在传输层赢得了用户的信任,但同时也悄然改写了你的负载均衡器、追踪流水线、自动伸缩器和成本模型原本遵循的契约。