推理集群:将SRE规范应用于多供应商LLM依赖管理
生产AI技术栈如今横跨多个供应商、微调端点和自托管模型。管理它们需要SRE风格的集群纪律:服务目录、按供应商的SLO追踪、容量规划以及清晰的所有权模型。
提示词版本管理问题:为什么你的提示词变更是未被追踪的生产风险
提示词变更与API契约变更一样可靠地破坏生产环境——但大多数团队在零版本管理、无评估、无回滚计划的情况下发布它们。以下是解决这一问题的工程纪律。
AI 旁观者效应:为什么五支团队协作发布却交付了无人问津的评估套件
AI 功能的失败与旁观者未能拨打 911 的原因如出一辙 —— 并不是因为没人注意到,而是因为每个人都认为别人会负责。为什么指定唯一的输出质量负责人 (DRI) 是唯一可扩展的解决方案。
AI 功能观察期:为什么两周的灰度发布会错过真正关键的问题
两周的灰度发布能捕捉到系统崩溃,但 AI 功能的失败通常表现为趋势性变化。本文深入探讨了观察期、慢性失败指标以及保持足够长有效期的回滚路径的实际案例。
闭环升级漏洞:当你的专精型智能体陷入循环路由
两个专精型智能体之间来回传递同一个对话,可能会在任何人察觉之前悄无声息地烧掉五万美元的推理成本。请将移交(handoffs)视为一种路由协议,而非领域抽象。
生产级智能体的 90 秒冷启动:当 LLM 不再是瓶颈时
生产级智能体在模型运行之前,通常需要 60 到 120 秒进行冷启动。解决方案不在于更快的 TTFT — 而在于将冷启动延迟视为一级 SLO,并通过预热池、快照/恢复、工具延迟加载以及 CI 门禁来进行优化。
Eval-as-Code:当你的发布门禁只是某人笔记本电脑上的一个 Notebook
决定你的模型是否发布的数字竟然存在于某人笔记本电脑上的一个 Notebook 中。你应该像对待生产系统一样对待评测套件 —— 对其进行版本化、设置准入规则并提供 SLO。
单用户 AI 配额:成本看板无法察觉的 UX 层
工程团队通常在完成总支出和每租户成本的监测后就此止步。但如果某个用户在周二下午 3 点触碰了配额上限,并收到一条令人费解的 429 错误代码,他们将再也不会信任这项功能。
运行时 Prompt 热重载:为什么你的 Prompt 不该被锁定在构建流程中
将 Prompt 变更与部署流水线耦合是一种自我限制。本文将探讨运行时热重载模式、其安全原语,以及那些无人预料到的故障模式。
模型回滚速度:从“这次升级有问题”到“旧模型完全恢复”之间的七小时鸿沟
回滚 LLM 升级并非按下一个按钮那么简单 —— 它是一个具有滞后性的部分操作,更接近于数据库迁移。在下一个错误模型上线之前,以下是你的事故应对指南中需要的控制平面。
提示词弃用合约:为什么措辞清理是一项破坏性更新
对系统提示词进行四个字的修改,就可能破坏那些固定了旧措辞的解析器、裁判和链式代理。提示词是拥有沉默消费者的 API —— 保持其稳定性的纪律与 REST 端点弃用的流程非常相似。
工具重入:你的函数调用层尚未察觉的 Bug 类别
函数调用层默认采用“即发即弃”模式,既没有调用栈也没有环路检测器——其代价体现在随着工具库的增长,单个请求的 Token 消耗量会不断攀升。