分词器漂移:你的本地计数在撒谎,账单才说真话
本地分词器与供应商计费计数在 CI 从未测试的长尾内容上存在 5%–15% 的差异。这一差距正在吞噬你用户实际使用场景下的安全边界。
工具重入:你的函数调用层尚未察觉的 Bug 类别
函数调用层默认采用“即发即弃”模式,既没有调用栈也没有环路检测器——其代价体现在随着工具库的增长,单个请求的 Token 消耗量会不断攀升。
Agent 飞行记录仪:在第一次事故发生前必须捕获的字段
当 Agent 脱轨时,大多数团队拥有的取证记录都是徒劳的。这里列出了飞行记录仪在第一次事故发生前必须捕获的字段,以及与之配套的存储、采样和隐私规范。
无真值情况下的智能体 SLO:为无法实时评分的输出建立错误预算
传统的 SRE 实践为你提供了与用户满意度直接挂钩的可用性和延迟目标。但智能体(Agentic)特性打破了这种映射。本文将介绍当“成功”在请求发出数小时后才出现时,该如何编写错误预算——以及为什么照搬延迟 SLO 手册的团队虽然能完成每个季度的目标,却眼睁睁看着用户流失。
30 秒都去哪了:APM 无法察觉的 Agent 步骤内部延迟归因
传统的 APM 将 Agent 的一个步骤视为单一的粗粒度 Span,导致值班工程师只能靠猜。通过将其分解为七个阶段,区分首字延迟 (Prefill) 与解码 (Decode),并追踪关键路径而非总 Span 时间。
智能体流量不等同于人类流量:为两类调用者设计 API
生产环境的 API 现在正在服务两类调用者——人类和智能体。它们具有不同的流量特征、故障模式和安全风险。在 2026 年,将它们混为一谈是所有关于端点不稳定问题调查的根源。
Agent 工作流的碳计算:Token 预算现已成为 ESG 披露
Agent 工作流消耗的能量可能是单次对话补全的 50–200 倍,采购团队已经开始关注这一指标。本文是一份关于逐任务碳归因、碳预算强制要求的路由决策,以及为什么率先进行观测的团队能掌控话语权的务实指南。
取消安全的智能体:你的“停止”按钮背后已经产生的副作用
“停止”只是一种 UI 手段,而非系统保证。这是一份针对取消安全智能体的从业者指南:持久化副作用账本、作用域授权、补偿操作,以及取消 UI 究竟应该显示什么。
复合型 AI 系统中的内部结算账本
复合型 AI 系统成本分摊指南 —— 涵盖 per-span 账本、on-behalf-of 标头、结算货币不匹配,以及决定谁为工具调用买单的治理策略。
LLM 工具表面的契约测试:当供应商更改字段而你的智能体静默适应时
当供应商重命名工具响应字段时,你的智能体不会崩溃 —— 它会自行适应并交付一个质量下降的答案。为什么微服务契约测试必须迁移到智能体技术栈,以及如何进行配置。
反事实日志:通过今天的充足记录,在明年的模型上重放昨天的流量
生产环境中的 LLM 日志能很好地回答“模型说了什么”,却难以回答“模型看到了什么” —— 正是这种差距导致了数月后的模型迁移评估宣告失败。本文介绍了一种用于可重放追踪的实用模式。
评测环境的延迟谎言:为什么你的 p95 在生产环境中翻倍
评测套件测量的是在一台安静机器上针对热缓存进行的串行调用;生产环境则是另一回事。将延迟视为部署的属性,而非模型的属性,否则你的 p95 数据将会具有误导性。