跳转到主要内容

那些被静音的 LLM 报警:当每一次值班看起来都和上一个一模一样

阅读需 1 分钟Tian PanTian Pan

一次真实的回归在生产环境中持续了两天。告警(Page)已经触发了。它触发得完全正确,阈值准确,严重程度也恰当。三周前,值班轮值(On-call rotation)为该告警族添加了一条静默规则,因为该系列中的每一条告警到目前为止都以同样的注释结案:“无须操作,调查中”。复盘(Post-mortem)无法诚实地将这种静默行为称为错误。这是对一系列值班人员没有 Playbook(运行手册)可循的告警流所做出的理性适应。那个重要的回归就在一个被静默的频道中发布了,因为团队的监控栈产生的信号无法指导具体行动,而团队唯一的应对方式就是:停止倾听。

这并不是一个告警 Bug。这是当团队沿用旧有的 Playbook 对 AI 功能进行埋点时,产生的一种结构性特征。延迟、错误率、拒绝率、输出 Schema 符合度、Judge-eval 漂移——每一个都是合理的指标。每一个触发时都带有同样模糊的“模型行为改变”措辞。但它们都没有告诉值班工程师该做什么,因为没有人写过将每个信号映射到具体动作的 Runbook,因为大多数情况下,信号并不能对应到具体的动作。值班轮值吸收着噪音,直到噪音盖过了信号,然后值班人员就会绕过产生这些信号的频道。

Catchpoint 2025 年度 SRE 报告将值班压力列为近 70% SRE 产生倦怠和离职的根源。标题背后的数字比看起来更糟糕。典型的企业轮值每天会收到来自各个渠道的数百个告警,而 Google 的 SRE Workbook 建议每班处理的可操作告警(Actionable pages)不应超过两个。“触发”与“可操作”之间的鸿沟就是轮值崩溃的地方,而 AI 功能正处于这一鸿沟最糟糕的一端,因为它们产生的每一个信号在结构上都是概率性的。值班人员的心智模型——“这个告警意味着 X 坏了,去做 Y”——对于卡住的部署很有效。但它不适用于“拒绝率在四小时窗口内波动了 0.4 个点”的情况。

为什么 AI 告警在结构上充满噪音

传统的告警之所以触发,是因为一个确定性的谓词翻转了。CPU 超过了 90%。部署流水线返回非零。健康检查超时。值班人员有一套清晰的假设和已知的调查路径。告警映射到 Runbook 中的条目,再映射到命令。事件发生期间的认知负荷虽然很高,但不同事件之间的结构是稳定的。

AI 功能的告警之所以触发,是因为分布发生了偏移。模型开始拒绝一类它以前会接受的请求。Schema 符合度从 99.1% 下降到 97.8%。对响应质量评分的 Judge-eval 漂移了 0.5 分。这些陈述都没有错。它们本身都不是故障。它们可能意味着上游模型出现了真实的回归。它们可能意味着一种良性的样本偏移(Cohort shift)——你的流量模式改变了,因为客户上线了一个新功能,向模型提出了不同的问题。它们可能意味着供应商在不同的集群间重新平衡了负载。它们也可能什么都不代表。

值班人员无法通过告警页面分辨其中的区别。所需的诊断步骤不是“SSH 到机器并读取日志”,而是“调取过去 24 小时的追踪(Traces),抽样 50 个,阅读它们,判断这种变化是回归还是偏移”。这至少是一个 20 分钟的任务,通常会更久,而且典型的答案是“无须操作”。当轮值人员第三或第四次白白支付这种成本后,他们就会意识到,这个代价不值得。

除此之外,LLM 可观测性市场已经趋向于为追踪的每一个指标都发出告警:忠实度(Faithfulness)下降、安全回归、Prompt 漂移、延迟长尾、Token 计数异常、成本飙升。每一个在孤立状态下看都是合理的。而总和则是轮值得为一个三个月前根本不会报警的功能,处理来自五个正交信号类别的告警。

静默规则的局部合理性

当轮值团队添加一条静默规则时,在场的没有任何人是在做错误的决定。他们观察了三周的告警,准确地注意到告警与操作的比率几乎为零。他们准确地注意到告警是有实际成本的:睡眠中断、从正在进行的工作中进行上下文切换、值班人员的流失。他们准确地注意到,即使告警代表了真实的情况,值班工程师也无法解决,因为诊断路径长达数小时且需要对功能有极深的熟悉度。

静默规则在轮值层面是理性的。但在系统层面,它会变得灾难性。被轮值团队静默的信号,正是本可以捕捉到真实回归的那个信号。团队并没有改进信号,而是消除了信号传递的频道。轮值团队以丧失在生产中检测质量回归的能力为代价,换取了即时的生活质量。

这与高误报率的癌症筛查具有相同的动态。在三次良性结果后,个人决定跳过检查是合理的;但在群体层面,结果就是对于关键病例的检测延迟。工程团队在处理身体健康问题时,是通过改进检测手段来解决的,而不是靠提高病人参加检查的自觉性。而在值班中,我们通常反其道而行之——我们试图提高工程师应对嘈杂告警的自觉性,并对这种自觉性撑不过一个季度感到惊讶。

会员专享

余下内容仅对会员开放。

会员可读完整内容 —— 每一个公开发布的观点背后,那些框架、决策与推理的全貌。

  • 完整文章,包含未公开存档的部分
  • 可落地的工作框架,附带权衡与决策依据
  • 新文章抢先看,先于公开发布

随时取消 · 一次订阅,畅读全部

参考资料

保持联系,关注我获取更多内容

阅读需 12 分钟

你的值班轮换需要 AI 素养作为前提,否则不要在凌晨 2 点给任何人发报警

当其中一个服务是基于 LLM 的功能时,共享值班轮换机制会立刻失效。这里有一份关于 AI 素养前提、仪表板规范以及影子期运行手册的指南,能让 AI 团队在凌晨 2 点安稳睡觉。

insider
on-call
阅读需 11 分钟

你的智能体平台忘了配置的值班轮换

一个四人的 AI 平台团队为一个拥有 200 名日活用户的内部智能体上线,却忘了配置值班轮换 —— 最终以惨痛的代价学习了 SRE 人员配置的计算方法。

insider
ai-platform
阅读需 11 分钟

那个假设人类会阅读页面的 On-Call 运维手册

当智能体在故障频道发布了一份客气的摘要,而指挥官将其理解为已接手时,升级链条中悄然出现了一个无人定义的转换点。本文将探讨弥补这一差距的模式。

insider
on-call
阅读需 11 分钟

智能体在凌晨 3 点呼叫我:触达人类工具的爆炸半径策略

授予智能体 PagerDuty 访问权限是一项会影响产品团队的基础设施决策。这是一个针对触达人类工具的控制平面 —— 包含速率限制、演练(dry-run)、退出机制(off-ramps)—— 且这些是 Prompt 无法强制执行的。

insider
ai-agents
阅读需 11 分钟

AI On-Call 心理学:为非确定性告警重建运维直觉

AI 系统的 On-Call 打破了标准的 SRE 直觉。本文提供了一套实用的分类法、轮值设计方案和培训课程,帮助你在不导致团队职业倦怠或错过真实回归的情况下,运行随机性生产系统。

insider
ai-engineering