·tian
凌晨三点调试 AI:LLM 驱动系统的故障响应指南
500 错误有堆栈跟踪,而糟糕的生成结果有概率分布。本文介绍如何在 AI 事故毁掉你的一周之前,对其进行分类、调试和事后复盘。
insider
observability
incident-response
llm
+2·tian
公开幻觉应对指南:当你的 AI 在公众场合说出蠢话时该怎么办
为面临公开 AI 幻觉事件的工程师和产品团队提供的实战指南——涵盖分类、根因分析、面向用户的沟通,以及真正能防止再次发生的事件后评估工作。
ai
llm
incident-response
hallucination
+1·tian
AI 回滚仪式:当损害是行为性而非二元性时的事故后恢复
LLM 系统中的行为回归不会导致测试失败或触发警报。本文将介绍如何检测、诊断并从这种看似成功的故障模式中恢复。
llmops
observability
reliability
incident-response
·tian
AI 辅助故障响应:为你的值班 Agent 提供运维手册
尽管 AI 投资创下纪录,但由于团队在部署 Agent 时缺乏运维手册或防护栅栏,运维负担反而有所增加。通过采用三层自治模型 —— 咨询型、审批型、条件型 —— 结合结构化运维手册和爆炸半径检查,可以将 AI Agent 转化为可靠的值班伙伴。
incident-response
sre
ai-agents
runbooks
+1·tian
AI 融入 SRE 循环:哪些有效、哪些失效,以及边界在哪里
LLM 可将 MTTR 缩短 40-70%,并在数分钟内自动生成故障复盘报告 —— 但凌晨三点一个自信却错误的诊断,远比聊天机器人出错危险得多。本文从实战角度拆解 AI 在哪些环节真正增强故障响应、在哪些场景自主行动会适得其反,以及决定最终结果的关键架构决策。
ai
sre
incident-response
llm
+1·tian
值班负担的转移:AI 功能如何打破你的事故响应手册
AI 功能引入了传统监控无法检测的故障模式——静默退化、服务商侧变更、提示词注入。本文是针对非确定性系统重建值班实践的实用指南。
insider
ai-engineering
sre
incident-response
+1显示第 37–42 篇,共 42 篇
上一页4 / 4