·tian
AI 融入 SRE 循环:哪些有效、哪些失效,以及边界在哪里
LLM 可将 MTTR 缩短 40-70%,并在数分钟内自动生成故障复盘报告 —— 但凌晨三点一个自信却错误的诊断,远比聊天机器人出错危险得多。本文从实战角度拆解 AI 在哪些环节真正增强故障响应、在哪些场景自主行动会适得其反,以及决定最终结果的关键架构决策。
ai
sre
incident-response
llm
+1·tian
值班负担的转移:AI 功能如何打破你的事故响应手册
AI 功能引入了传统监控无法检测的故障模式——静默退化、服务商侧变更、提示词注入。本文是针对非确定性系统重建值班实践的实用指南。
insider
ai-engineering
sre
incident-response
+1·tian
非确定性系统的 SLO:当每次响应都不同时如何定义可靠性
传统 SLI(如延迟和错误率)无法捕捉 AI 系统的主要故障模式——执行正确但答案错误。本文提供了一套实用框架,涵盖语义 SLO、85% 基线下的错误预算,以及能区分真实退化和正常波动的告警架构。
reliability
sre
ai-engineering
observability
显示第 49–51 篇,共 51 篇
上一页5 / 5