跳转到主要内容

6 含有标签「postmortem」

Posts tagged "postmortem" on TianPan.co.

查看所有标签

·tian

没有根本原因的事后分析

“五个为什么”事件回顾假设存在一个模型并不具备的确定性原因。本文将介绍如何编写一份真实的 LLM 事后分析报告,它建立在故障率增量和促成因素堆栈之上,而非寻找单一的根本原因。

insider
postmortem
llm
reliability
+2
·tian

第四方风险:当供应商的供应商掌控了你客户的故障

你的合同签署了一家供应商,但你的故障报告却指向了其背后的一层。本文教你如何梳理第四方风险、衡量真实冗余,以及如何撰写一份你无法完全掌控的故障复盘报告。

reliability
vendor-risk
llm-ops
slo
+1
·tian

没有模型推理项的故障复盘模板

大多数事件模板都没有留出记录 AI Agent 推理内容的栏位——导致行动项在试图为概率性失效寻找确定性的解决方案,从而使得同一类故障不断重复发生。

postmortem
sre
ai-agents
incident-response
+1
·tian

从 Bug 到行为率:没有复现步骤的 AI 事后分析

没有复现步骤的 AI 故障并非调试失败 —— 它是系统在告诉你,单一的错误输出只是分布中的一个采样,而非确定性的 Bug。事后分析的形式必须随之改变。

ai-agents
postmortem
reliability
observability
+1
·tian

你的 SRE 复盘模板遗漏了决定每次 LLM 故障的六个关键字段

传统的 SRE 复盘模板是为代码变更和基础设施故障设计的。对于 LLM 故障,真正发生变化的变量往往被遗漏了——如 Prompt 版本、模型选择切片、裁判配置、检索索引状态、工具 Schema 以及流量组合。本文提供了填补这一空白的模板字段和故障类别分类法。

insider
ai-engineering
observability
sre
+2
·tian

为何"修改提示词"是根因谬误:为 AI 系统打造无责事后复盘

「修提示词」的反射动作正在取代 AI 事件复盘中真正的根因分析。本文解释为何如此,以及如何将无责 SRE 文化应用于非确定性系统。

ai-engineering
sre
observability
postmortem