凌晨 3 点拥有合并权限的 CI Agent
把一个有合并权限的 AI Agent 接入 CI,就在你的体系里创造了一种 SRE 手册从未命名过的新型操作主体。给它的动作分级、把不能无人值守的动作排进队列、为每次变更留下可追溯的归属,并定期演练它的紧急停机开关。
在用户说"是"之前就已提交的流式响应
流式 UX 继承了一个工具调用并不遵守的可逆性契约。本文剖析为何停止按钮无法撤回已发送的邮件,以及修复这一问题所需的框架变更。
你的智能体审计日志记录了一切,唯独没有记录原因
完整的智能体追踪展示了发生了什么,却从未解释原因。为什么可观测性并不等同于可解释性,为什么记录的思维链可能是虚构的,以及如何捕捉能通过监管机构审查的决策依据。
流式 Token 是无法收回的承诺
当背后的工具调用失败时,原本自信的流式回答就会崩溃。流式传输是一种不可逆的契约 —— 有一些模式可以在不牺牲感知延迟的情况下重新获得选择权。
那个把上周 Slack 消息当成昨天消息来读的智能体
一个智能体检索到一条 6 周前写的“我们明天发布”的消息,并将其视为当前的计划。检索流水线保留了正文,却弄丢了时钟。
停不下来的 Agent:作为运行时故障模式的范围蔓延
Agent 修复了 Bug,然后继续运行——重构周围的代码、扩大范围、消耗大量 Token。这是一份关于在范围蔓延演变成静默故障模式之前,如何为 Agent 任务设计停止标准、步数预算和“完成”信号的指南。
你从未构建过的智能体反馈闭环
每一个点踩、每一次无声的放弃、每一次重新表述的问题,都是一个免费的带标签失败案例 —— 而大多数团队却将其丢弃。本文介绍如何构建从用户信号到分诊失败再到永久评估案例的流水线。
为什么你不能用单一数字来估算 AI 功能的预算
AI 智能体的单次请求成本是一个肥尾分布,而非一个固定数字。本文探讨了为什么平均单位成本会使预测和定价失效,以及你应该报告哪些指标 —— p50 、 p99 、 尾部支出和多租户成本归属。
上下文长度是安全边界,而不仅仅是成本线
足够长的对话会将你的系统提示词埋在更新的 Token 之下,直到防护栏悄然失效。为什么上下文长度属于威胁模型——以及如何控制它。
演变成产品决策的速率限制
供应商配额不再仅仅局限于后端。当智能体在任务执行过程中达到每分钟 Token 数上限时,失败会直接反馈给用户 —— 因此,速率限制现在成了产品设计必须考虑的一部分。
你的工具描述是模型遵循的指令通道
工具描述是模型视为权威指令的散文,但代码审查和输入清理从未检查过它们。本文将探讨被投毒的元数据和地毯式攻击是如何渗透进来的,以及弥合这一差距的规范。
当“智能体能做 X 吗?”演变为交付承诺时
当“运行成功一次”的说法经过每日站会、路线图和销售电话后,AI 能力探针会悄然演变为路线图承诺。本文介绍了一套能力测试产物和晋级关卡,旨在防止演示原型在不成熟时就变成合同条款。