跳转到主要内容

9 含有标签「on-call」

Posts tagged "on-call" on TianPan.co.

查看所有标签

·tian

让 Agent 先接警:AI 故障响应的信任阶梯

故障发生的最初 15 分钟通常是机械化的,Agent 可以在你解锁笔记本电脑前就完成这些工作。这套由叙述者、建议者、受控执行者、受限自动修复者组成的四层信任阶梯,配合基于证据的晋升和有范围的降级机制,比在经历一个糟糕的夜晚后彻底禁用自动化要明智得多。

insider
incident-response
ai-agents
sre
+2
·tian

那些被静音的 LLM 报警:当每一次值班看起来都和上一个一模一样

当看起来完全相同的报警不断出现却无法触发任何后续行动时,LLM 功能的告警疲劳便悄然而至。随之而来的静音规则虽然是理性的适应行为,却最终破坏了生产环境的检测机制。

insider
llm-observability
on-call
alert-fatigue
+2
·tian

你的智能体平台忘了配置的值班轮换

一个四人的 AI 平台团队为一个拥有 200 名日活用户的内部智能体上线,却忘了配置值班轮换 —— 最终以惨痛的代价学习了 SRE 人员配置的计算方法。

insider
ai-platform
on-call
sre
+2
·tian

那个假设人类会阅读页面的 On-Call 运维手册

当智能体在故障频道发布了一份客气的摘要,而指挥官将其理解为已接手时,升级链条中悄然出现了一个无人定义的转换点。本文将探讨弥补这一差距的模式。

insider
on-call
incident-response
ai-agents
+2
·tian

你的智能体没读过的那条休假自动回复

大多数智能体堆栈按姓名而不是按角色呼叫真人 —— 一旦有人休 PTO,智能体就会和自动回复对打,直到值班同事注意到。

insider
ai-agents
escalation
on-call
+2
·tian

凌晨 3 点处理一个没有报 500 错误的 AI 功能报警

传呼机响了,是因为流量评估得分下降了四个百分点,而不是因为服务崩溃。本文探讨针对现有告警无法触发的故障模式,如何制定运维手册(Runbook)模式、告警设计以及轮值纪律。

ai-engineering
on-call
sre
observability
+1
·tian

你的值班轮换需要 AI 素养作为前提,否则不要在凌晨 2 点给任何人发报警

当其中一个服务是基于 LLM 的功能时,共享值班轮换机制会立刻失效。这里有一份关于 AI 素养前提、仪表板规范以及影子期运行手册的指南,能让 AI 团队在凌晨 2 点安稳睡觉。

insider
on-call
ai-engineering
sre
+2
·tian

智能体在凌晨 3 点呼叫我:触达人类工具的爆炸半径策略

授予智能体 PagerDuty 访问权限是一项会影响产品团队的基础设施决策。这是一个针对触达人类工具的控制平面 —— 包含速率限制、演练(dry-run)、退出机制(off-ramps)—— 且这些是 Prompt 无法强制执行的。

insider
ai-agents
mcp
on-call
+2
·tian

AI On-Call 心理学:为非确定性告警重建运维直觉

AI 系统的 On-Call 打破了标准的 SRE 直觉。本文提供了一套实用的分类法、轮值设计方案和培训课程,帮助你在不导致团队职业倦怠或错过真实回归的情况下,运行随机性生产系统。

insider
ai-engineering
observability
sre
+2