跳转到主要内容

42 含有标签「incident-response」

Posts tagged "incident-response" on TianPan.co.

查看所有标签

·tian

无故障停机情况下的面向客户 AI 质量退化复盘指南

状态页显示正常,错误率为零,但客户依然不满意。这是一份关于在没有发生系统崩溃时编写 AI 质量退化复盘报告的实战指南——涵盖了根因术语、严重程度分级以及闭环后续跟进的节奏。

insider
ai-engineering
incident-response
llm-ops
+1
·tian

没人愿意写的 AI 事故复盘:四层诊断框架

当 AI 功能引发生产事故时,标准的复盘流程往往失效。本文提出一套四层诊断框架——模型层、数据层、集成层、基础设施层——帮助团队在不陷入责任推诿的情况下明确责任归属。

insider
ai-engineering
mlops
incident-response
+1
·tian

过度纠正陷阱:为什么在 AI 功能公开失败后下架它反而让恢复更慢

当你的 AI 功能公开失败时,下架它或堆砌护栏的本能反应会让恢复延迟数月。以下是为什么冷启动信任修复与软件 Bug 修复的运作方式截然不同——以及应该怎么做。

ai-reliability
incident-response
trust
product-strategy
·tian

你的 AI 功能需要一个无需部署的紧急开关 (Kill Switch)

一次标准的部署回滚需要 30 分钟;而一个表现异常的 LLM 仅需几秒钟就能向客户发送错误的输出。这里是你的 AI 功能在发生首次故障前所需的关闭原语——四种标志系列、触发它们的检测信号,以及确保其有效的测试规范。

insider
ai-engineering
sre
incident-response
+2
·tian

禁用开关才是真正的产品:设计非 AI 回退路径

大多数 AI 功能自带的禁用开关只会返回错误。请将“关闭状态”视为一个真正的产品,配备功能级标志、确定性回退机制,并采用与“开启状态”相同的评估准则。

ai-engineering
reliability
product-design
feature-flags
+1
·tian

上线 AI 功能后的头 100 个工单

每个 AI 功能上线都会产生的为期八周的运维工单序列——成本激增、评估偏移、长尾延迟、供应商静默更新——以及预置了应对方案的上线指南。

insider
ai-engineering
llm-ops
incident-response
+2
·tian

你遗漏订阅的模型提供商 Webhook 通知

主要的 LLM 提供商通过 Webhook 和电子邮件广播故障、模型弃用和账户警告,而大多数团队都关闭了这些渠道。本文将介绍一个小巧的集成方案,帮助你把“从客户那里发现问题”转变为“在自有监控系统报警前就通过提供商获知信息”。

ai-engineering
llm-ops
observability
incident-response
+1
·tian

你的值班轮换需要 AI 素养作为前提,否则不要在凌晨 2 点给任何人发报警

当其中一个服务是基于 LLM 的功能时,共享值班轮换机制会立刻失效。这里有一份关于 AI 素养前提、仪表板规范以及影子期运行手册的指南,能让 AI 团队在凌晨 2 点安稳睡觉。

insider
on-call
ai-engineering
sre
+2
·tian

五面分诊树:当常规操作手册不再适用时的 AI 轮值指南

如果报警显示模型开始撒谎,那么为“重启服务”设计的传统操作手册就不再适用了。本文介绍了五面分诊树、冻结按钮以及重放测试框架,正是这些工具让 AI 轮值成为了一门独立的学科。

ai-oncall
sre
incident-response
llm-ops
+1
·tian

你的 SRE 复盘模板遗漏了决定每次 LLM 故障的六个关键字段

传统的 SRE 复盘模板是为代码变更和基础设施故障设计的。对于 LLM 故障,真正发生变化的变量往往被遗漏了——如 Prompt 版本、模型选择切片、裁判配置、检索索引状态、工具 Schema 以及流量组合。本文提供了填补这一空白的模板字段和故障类别分类法。

insider
ai-engineering
observability
sre
+2
·tian

你的 stop_reason 在说谎:构建生产环境故障排查真正需要的停止分类法

厂商提供的 stop_reason 值只给了你四个分类,但生产环境的故障排查通常需要八个。本文将介绍如何构建并行停止分类法,将黑盒式的终止转换为可调试的信号。

llm
observability
ai-engineering
incident-response
+1
·tian

Token 消耗是你的 SOC 尚未监控的安全信号

异常的 LLM Token 消耗是 API Key 被盗、提示词注入或数据外泄的最早信号 —— 但目前看板归财务管,响应归安全管。本文将介绍如何将两者打通。

insider
security
llm-ops
finops
+2
显示第 13–24 篇,共 42 篇