你定义‘首个 Token’的位置决定了你的延迟 SLO 是否真实
p99 首个 Token 延迟低于 800 毫秒看起来像是一个承诺——直到推理层的切换悄然重新定义了‘首个 Token’的含义。SLO 衡量的是供应商边界;而用户的感受则完全不同。
你的代码从未检查过的 Finish Reason
每个推理 API 在返回文本的同时都会返回一个停止信号。忽略它与忽略 HTTP 状态码的错误本质相同 —— 而且你的仪表盘无法察觉它所导致的失败。
Agent 循环从搜索框偷走的延迟预算
将 200 毫秒的搜索调用换成 4 秒的 Agent 循环,延迟预算并没有消失 —— 它从基础设施迁移到了 UX。如果团队没有捕捉到这种交接,就会在交付一个指标更好但实际体验更差的产品。
那个因为模型拒绝处理难题而提升的成功指标
模型升级后任务完成率的提升,可能意味着智能体变得更强了 —— 也可能意味着它不再尝试处理难题。请分解你的成功指标,否则流失率将让你付出代价。
那些你的真实用户永远不会表现出的合成评估
由受测模型的“兄弟模型”生成的合成评估会在用户行为发生偏移时虚增评分。本文探讨了为什么生成器-判别器坍塌会掩盖质量退化,以及如何通过野外评估(wild-eval)架构来捕捉这些问题。
那个直到触发时你才察觉的 Token 预算
提供商的 API 会暴露每分钟速率限制响应头,但绝不会透露你的集群实际上需要依此规划的每月上限 —— 这导致消费者必须在第 26 天 429 错误到来之前,自行构建计量器、层级抽象和资源饥饿规则。
你的 Agent 悄然适应了的那次工具版本升级
Agent 会悄无声息地消化工具的破坏性变更,因为它们对结构变化的包容性掩盖了原本能被严格客户端捕捉到的信号。本文介绍了如何让这些脆弱性重新显现出来的模式。
不可信的 Trace Replay:为什么你的新模型评估在撒谎
Trace replay 在一个已不存在的上下文中验证 LLM 升级。本文将揭示为什么那些绿色的评估指标在撒谎,以及在成本与信号的曲线上,哪些验证原语分别适用于哪个阶段。
止于供应商边界的链路追踪
你的分布式链路追踪往往在推理 API 的边缘中断。本文将介绍如何对流式数据块、请求 ID 和供应商侧信道进行插桩,从而找回流水线中最昂贵的分钟级性能损耗。
你的定时 Agent 有四个时钟,而你信任的是错误的那一个
通过 cron 触发的 AI Agent 继承了四个时钟 —— 调度器、工作节点、模型和工具 —— 而大多数生产系统都在默默地信任错误的那一个。本文将带你了解这些失败模式以及防止这些问题的‘时间交接合约’。
那个用一小时反复重试同一个 400 错误的 Agent
400 不是瞬时错误。把它当瞬时错误处理的重试循环,就是 agent 用一小时、一份预算、一个限流额度反复砸同一个错误负载的根源。
把沉默当作同意的 ChatOps 机器人
ChatOps 机器人不再收到回复时,仪表盘看起来是稳态——但静音、复问和旁路动作才说出了真相。围绕沉默来仪表化智能体的实战手册。