你用智能体替换的内部搜索框刚刚成为了你的 SLO
停用一个确定性功能而转用智能体,会悄无声息地将前任的 SLO 移交给一个无法满足它的系统 —— 而这种差距会在你的推理提供商进行限流的那个早晨显现出来。
那个假设人类会阅读页面的 On-Call 运维手册
当智能体在故障频道发布了一份客气的摘要,而指挥官将其理解为已接手时,升级链条中悄然出现了一个无人定义的转换点。本文将探讨弥补这一差距的模式。
没有模型推理项的故障复盘模板
大多数事件模板都没有留出记录 AI Agent 推理内容的栏位——导致行动项在试图为概率性失效寻找确定性的解决方案,从而使得同一类故障不断重复发生。
把自己调度进维护窗口的 Agent
Agent 会一头扎进部署冻结期、活跃事故和飘红的状态页执行多步计划——因为它读不到人类天然吸收的那些侧信道。这篇文章讲怎么补上这个洞。
凌晨 3 点拥有合并权限的 CI Agent
把一个有合并权限的 AI Agent 接入 CI,就在你的体系里创造了一种 SRE 手册从未命名过的新型操作主体。给它的动作分级、把不能无人值守的动作排进队列、为每次变更留下可追溯的归属,并定期演练它的紧急停机开关。
你的备用路径是生产环境中唯一未经测试的代码
你为应对故障而构建的降级路径几乎从不运行,因此它在寂静中腐烂,并在其本应应对的事故发生时才首次亮相。
当 Agent 出错时谁会被呼叫:针对非确定性系统的轮值制度
Agent 的故障难以复现、无法回滚,且在所有的基础设施仪表板上都显示正常。本文将教你如何针对无法单步调试的系统,重写运行手册、警报规则和轮值预期。
先返回 200 然后失败的流式响应:中途错误如何破坏你的 SLO
流式端点在第一个 token 刷出的瞬间就会确认 200 状态,因此之后发生的每一个失败都会躲过负载均衡器、重试中间件和 SLO 仪表板。本文将介绍如何让响应体承担起 HTTP 头部已无法传达的判定结论。
拒绝“大声失败”的 Agent:过度补偿的回退机制如何掩盖生产环境的质量回退
生产环境中的 Agent 积累了大量的重试、回退和修复逻辑,这些逻辑会悄悄掩盖质量回退,直到流量评估指标发生偏移,而团队却无法追踪根本原因。
AI 网关:那个没人点名的单点故障 (SPOF)
位于 LLM 供应商前端的这一层薄抽象,已成为你发布的每一项 AI 功能的承重控制平面。本文探讨了为什么它的爆炸半径现在已经超过了任何供应商的中断风险,以及随之而来的 SRE 规范。
凌晨 3 点处理一个没有报 500 错误的 AI 功能报警
传呼机响了,是因为流量评估得分下降了四个百分点,而不是因为服务崩溃。本文探讨针对现有告警无法触发的故障模式,如何制定运维手册(Runbook)模式、告警设计以及轮值纪律。
AI Ops 不仅仅是平台工程:运行 LLM 服务如何颠覆你的 SRE 策略手册
运行 LLM 服务需要一种与微服务截然不同的运营准则。本文将探讨现有的 SRE 策略手册在哪些方面可以迁移、在哪些方面会失效,以及你尚未具备的新型运维手册类别。