跳转到主要内容

51 含有标签「sre」

Posts tagged "sre" on TianPan.co.

查看所有标签

·tian

你的 SRE 复盘模板遗漏了决定每次 LLM 故障的六个关键字段

传统的 SRE 复盘模板是为代码变更和基础设施故障设计的。对于 LLM 故障,真正发生变化的变量往往被遗漏了——如 Prompt 版本、模型选择切片、裁判配置、检索索引状态、工具 Schema 以及流量组合。本文提供了填补这一空白的模板字段和故障类别分类法。

insider
ai-engineering
observability
sre
+2
·tian

负载降级是为人类设计的,而 Agent 会放大你正在抵御的风暴

Agent 会围绕 503 错误重新规划并以远超人类的速度重试,将上游的小幅波动演变成关联性停机。本文从实践者视角出发,探讨平台下一步需要的负载降级原语,以及 Agent 为了避免成为“风暴”而必须遵循的纪律。

insider
agents
reliability
sre
+2
·tian

智能体在凌晨 3 点呼叫我:触达人类工具的爆炸半径策略

授予智能体 PagerDuty 访问权限是一项会影响产品团队的基础设施决策。这是一个针对触达人类工具的控制平面 —— 包含速率限制、演练(dry-run)、退出机制(off-ramps)—— 且这些是 Prompt 无法强制执行的。

insider
ai-agents
mcp
on-call
+2
·tian

你的 AI 产品在需要另一个模型之前,更需要一名 SRE

大多数举步维艰的 AI 团队都在用 2012 年时代的运营方式运行前沿模型。解决这一问题的下一个关键员工通常是 SRE,而不是另一位应用科学家。

sre
ai-engineering
reliability
llmops
+1
·tian

AI 事故响应手册:为什么你的值班 Runbook 对 LLM 不管用

传统值班 Runbook 在 AI 系统中会失效,因为故障是非确定性的、质量下降没有错误码,根本原因排查需要一套完全不同的框架。本文介绍真正有效的做法。

insider
ai
llm
observability
+2
·tian

为何"修改提示词"是根因谬误:为 AI 系统打造无责事后复盘

「修提示词」的反射动作正在取代 AI 事件复盘中真正的根因分析。本文解释为何如此,以及如何将无责 SRE 文化应用于非确定性系统。

ai-engineering
sre
observability
postmortem
·tian

随机系统的值班响应:为何你的 AI 运行手册需要重写

传统故障响应假设故障是可复现的,但 LLM 驱动的系统并非如此。以下是如何针对非确定性 AI 重写告警方案、分类决策树和事后分析模板。

insider
ai-engineering
sre
incident-response
+2
·tian

非确定性 AI 功能的 SLO:当“错误”具有概率性时,如何设置错误预算

标准的可用性和错误率 SLO 无法捕捉 LLM 功能中的行为质量下降。本文将介绍如何定义行为质量 SLO,设置有意义的错误预算,并在正确性具有概率性时将其接入事件响应流程。

ai-engineering
sre
observability
llm
+1
·tian

没人会写的 AI 系统 On-Call 运维手册

当故障模式是概率性的模型行为而非服务崩溃时,传统的 SRE 运维手册就会失效。本文将探讨 LLM 驱动系统的事故响应究竟是怎样的,以及哪些信号值得告警。

insider
ai-engineering
observability
sre
+2
·tian

AI 辅助故障响应:LLM 如何在不取代 SRE 手册的情况下改变它

值班工作流中的 AI 副驾驶可以浮现关联信号、起草运行手册操作——但它们引入了传统 SRE 没有受过训练去识别的故障模式。这是一份将 LLM 整合进故障响应而不让故障更难处理的实践指南。

sre
incident-response
llm
observability
+1
·tian

AI On-Call 心理学:为非确定性告警重建运维直觉

AI 系统的 On-Call 打破了标准的 SRE 直觉。本文提供了一套实用的分类法、轮值设计方案和培训课程,帮助你在不导致团队职业倦怠或错过真实回归的情况下,运行随机性生产系统。

insider
ai-engineering
observability
sre
+2
·tian

AI 辅助故障响应:为你的值班 Agent 提供运维手册

尽管 AI 投资创下纪录,但由于团队在部署 Agent 时缺乏运维手册或防护栅栏,运维负担反而有所增加。通过采用三层自治模型 —— 咨询型、审批型、条件型 —— 结合结构化运维手册和爆炸半径检查,可以将 AI Agent 转化为可靠的值班伙伴。

incident-response
sre
ai-agents
runbooks
+1
显示第 37–48 篇,共 51 篇