推理集群:将SRE规范应用于多供应商LLM依赖管理
生产AI技术栈如今横跨多个供应商、微调端点和自托管模型。管理它们需要SRE风格的集群纪律:服务目录、按供应商的SLO追踪、容量规划以及清晰的所有权模型。
你的 AI 功能需要一个无需部署的紧急开关 (Kill Switch)
一次标准的部署回滚需要 30 分钟;而一个表现异常的 LLM 仅需几秒钟就能向客户发送错误的输出。这里是你的 AI 功能在发生首次故障前所需的关闭原语——四种标志系列、触发它们的检测信号,以及确保其有效的测试规范。
个性化设置应当属于 Dotfile,而非向量数据库
大多数 Agent 的个性化其实是语气、格式、默认工具和项目上下文 —— 这些声明式设置在数十年前就通过 Dotfile 模式解决了。只有在穷尽配置手段后,才应考虑微调和持久化记忆。
人工审核队列是你的 P0 SLA:当 HITL 成为瓶颈时
三个月前你为了安全性而设置的人机回环(HITL)升级路径,现在正成为你 AI 功能的无形瓶颈。本文将探讨如何将其视作一个拥有独立 SLO、容量模型和反馈循环的生产系统来对待——在客户向你投诉之前,先发制人。
仪表盘视为噪点的周一早晨 AI 性能下降
大多数 AI 功能仪表盘通过取平均值抹平了一种导致真金白银损失的故障模式 —— 这种每周循环的性能下降,只有当你按小时维度拆解延迟、缓存命中率和重试次数时才会显现。
模型回滚速度:从“这次升级有问题”到“旧模型完全恢复”之间的七小时鸿沟
回滚 LLM 升级并非按下一个按钮那么简单 —— 它是一个具有滞后性的部分操作,更接近于数据库迁移。在下一个错误模型上线之前,以下是你的事故应对指南中需要的控制平面。
你的值班轮换需要 AI 素养作为前提,否则不要在凌晨 2 点给任何人发报警
当其中一个服务是基于 LLM 的功能时,共享值班轮换机制会立刻失效。这里有一份关于 AI 素养前提、仪表板规范以及影子期运行手册的指南,能让 AI 团队在凌晨 2 点安稳睡觉。
Agent 飞行记录仪:在第一次事故发生前必须捕获的字段
当 Agent 脱轨时,大多数团队拥有的取证记录都是徒劳的。这里列出了飞行记录仪在第一次事故发生前必须捕获的字段,以及与之配套的存储、采样和隐私规范。
无真值情况下的智能体 SLO:为无法实时评分的输出建立错误预算
传统的 SRE 实践为你提供了与用户满意度直接挂钩的可用性和延迟目标。但智能体(Agentic)特性打破了这种映射。本文将介绍当“成功”在请求发出数小时后才出现时,该如何编写错误预算——以及为什么照搬延迟 SLO 手册的团队虽然能完成每个季度的目标,却眼睁睁看着用户流失。
五面分诊树:当常规操作手册不再适用时的 AI 轮值指南
如果报警显示模型开始撒谎,那么为“重启服务”设计的传统操作手册就不再适用了。本文介绍了五面分诊树、冻结按钮以及重放测试框架,正是这些工具让 AI 轮值成为了一门独立的学科。
编程智能体自主曲线:阅读是免费的,合并是事故级的
对于编程智能体来说,单一的自主开关是错误的抽象方式。应该将每个工具映射到特定的爆炸半径层级,根据层级调整审批闸门,并使智能体的执行速度与你的回滚速度相匹配。
当需求是悬崖而非曲线时,如何进行 GPU 产能规划
Agent 工作负载打破了平滑曲线的产能规划。请以 Token 为单位进行规划,将扇出视为一级指标,并针对预见性的“悬崖式”需求预留产能。