那个假设人类会阅读页面的 On-Call 运维手册
当智能体在故障频道发布了一份客气的摘要,而指挥官将其理解为已接手时,升级链条中悄然出现了一个无人定义的转换点。本文将探讨弥补这一差距的模式。
没有模型推理项的故障复盘模板
大多数事件模板都没有留出记录 AI Agent 推理内容的栏位——导致行动项在试图为概率性失效寻找确定性的解决方案,从而使得同一类故障不断重复发生。
你为人类设置的速率限制,AI 智能体三秒钟就会让其饱和
为人类节奏流量校准的速率限制,在智能体首次将规划循环指向端点时就会崩溃。应将限制视为一种拆分契约 —— 吞吐量预算加上滥用上限 —— 并基于租户和工作负载类别进行挂钩。
智能体安排的无人继承的周期性任务
当一个智能体启动了一项周期性任务然后离去,该计划的寿命将超过其所有者 —— 孤儿率会在悄无声息中累积,直到有人进行审计。
你的定时 Agent 有四个时钟,而你信任的是错误的那一个
通过 cron 触发的 AI Agent 继承了四个时钟 —— 调度器、工作节点、模型和工具 —— 而大多数生产系统都在默默地信任错误的那一个。本文将带你了解这些失败模式以及防止这些问题的‘时间交接合约’。
你没列进预算的"弃答税"
教会 Agent 说"我不知道"看上去是安全胜利,直到人工队列接下账单为止。本文给出把 LLM 弃答视为成本转移动作时的端到端账本。
那个用一小时反复重试同一个 400 错误的 Agent
400 不是瞬时错误。把它当瞬时错误处理的重试循环,就是 agent 用一小时、一份预算、一个限流额度反复砸同一个错误负载的根源。
无法说出"等一下"的智能体
生产环境中的智能体可以执行动作、给出答案或提出问题——但说不出"等一下"。缺失的原语如何把犹豫挤压成无谓的工具调用和过度自信的承诺,以及如何把审议重新纳入协议。
当昨天的进度本身就是谎言:AI 时代的站会怎么开
当 Agent 通宵跑任务、并且在站会结束三小时后才收工时,轮流播报式的站会就垮了。从仪表盘上读一份队列快照,比 Scrum 的"三连问"更接近诚实汇报。
把沉默当作同意的 ChatOps 机器人
ChatOps 机器人不再收到回复时,仪表盘看起来是稳态——但静音、复问和旁路动作才说出了真相。围绕沉默来仪表化智能体的实战手册。
你的 Agent 没有留下的那本证据档案
调用链路告诉你 Agent 做了什么。决策记录告诉你 Agent 当时手上有什么。多数团队只交付了其中一种,等审计来了才发现缺口。
把每个工具都当作 O(1) 的规划器
为什么智能体规划器会选出正确但代价极高的工具序列,以及无需重新训练模型即可让规划具备成本感知能力的模式级改造。