那些由于模型选择了不同的 Token 而无法复现的 Bug
重现一个 LLM bug 时看到它通过了,并不意味着 bug 消失了 —— 而是意味着你抽取到了不同的样本。当你的工具假设一切都是确定性的,该如何调试一个采样器。
当每个请求的思考成本各不相同时的容量规划
智能体请求的成本并不稳定 —— 一个请求可能只需 200 个 Token 就能解决,而下一个请求可能会耗费 100 万个。为什么 p50 预测在智能体工作负载中会失效,以及如何改为基于 Token 和工具调用分布进行规划。
AI 功能规格说明书中无人提及的碳排放项
每一场 AI 功能评审都在争论延迟、Token 成本和准确率——却唯独没人讨论能耗。本文将介绍如何衡量单次请求的碳排放,并将其转化为团队需要负责的关键指标。
你的重试逻辑正在给 Agent 传达错误的教训
为不稳定的网络设计的重试策略假设调用者是正确的。但 Agent 让调用者变成了不可靠的部分,盲目的重试会悄悄地将真实的 Bug 洗白成绿色的勾。
你从未构建过的智能体反馈闭环
每一个点踩、每一次无声的放弃、每一次重新表述的问题,都是一个免费的带标签失败案例 —— 而大多数团队却将其丢弃。本文介绍如何构建从用户信号到分诊失败再到永久评估案例的流水线。
那个本该计算却随口编造数字的智能体
LLM 智能体往往会随口说出一个看似合理的数字,而不是去进行计算,流畅的文字掩盖了缺失的工具调用。本文探讨如何强制使用工具并为每一个数据附上出处。
难以调试的庞大 Agent 追踪:当记录了一切却读不懂任何内容时
记录完整的 Agent 追踪会让故障信息变得完整,但却难以阅读。真正的可观测性瓶颈在于:在事故冷却前,人类是否能找到那步至关重要的操作。
无人清理的审批队列
风险分层门控将危险的智能体操作路由到人工队列 —— 但一个没有负责人、没有 SLO 且没有超时策略的队列,只是另一种更慢的失败方式。本文探讨如何像管理真实的基础设施一样运营人工闸口。
智能体从未接收到的服务降级信号
调用下游 API 的智能体只能看到其最后一次请求的响应——没有状态页面、没有变更日志、没有警告横幅。本文探讨了为什么智能体会直接陷入服务部分故障(brownouts)和速率限制,以及如何构建侧信道,以传递那些智能体从未被赋予收听方式的运维信号。
你的评测集是一张用户早已离开的流量快照
基准测试的提升衡量的是用户早已离开的分布上的进展。本文探讨评测集陈旧、幸存者陷阱以及单一聚合指标如何掩盖无声的衰退 —— 以及你如何让评测始终紧跟流动的动态。
没有复现步骤的故障工单:可复现性是工程化的结果
一个智能体删除了错误的记录,而事后剖析报告中却找不到原因。AI 智能体的可复现性并非技术栈自带的属性——它是你需要有意识地去捕获、进行版本控制并回放的东西。
LLM 裁判是一个带版本的依赖,而非中立的基础设施
使用 LLM 裁判为模型输出评分,而裁判本身也是一个具有特定行为的模型。当它发生变化的那天,所有的历史分数都会变成“外币”——而大多数团队从未察觉到这一点。