当时钟成为工具:Agent、时区以及那个只在午夜发生的 Bug
LLM 没有内部时钟,因此 Agent 会自信地漂移到过时的时间上——这表现为错过的任务调度、错误的时区计算以及破坏缓存的时间戳。本文将介绍如何将当前时刻作为基础设施来提供。
3% 的回归不会让报警器响起:应对统计性故障的轮值工作
传统的轮值工作能够捕获系统崩溃和延迟激增。但真正损害 AI 产品的是那些悄无声息的 3% 质量下降,任何阈值都不会被触发。本文将介绍如何为统计性故障构建告警机制。
用户学会利用 Agent 超时机制套取退款
某 Agent 平台慷慨的“超时退款”政策催生了一个特定的用户群体,他们系统性地利用这一边界规则,使超时率翻倍,并将这种行为伪装成产品质量退化。
在网关层交换了两个用户上下文的 conversation_id 冲突
扁平的 conversation_id 命名空间加上各层漂移的 UUID 生成器,可能会在网关层交换两个用户的上下文。请像支付团队对待交易 ID 一样严谨地对待会话 ID。
当用户取消对话后,下游 API 却仍在继续写入
点击停止按钮可以干净地关闭 LLM 流。但这并不会停止工具已经向第三方开启的 HTTP 请求,而第三方并不知道对话已经结束。本文将解释为什么 AbortSignal 止步于套接字,以及你应该在提交边界构建什么来替代它。
供应商上调 max_tokens 默认值,导致你的尾部响应长度翻倍
一家 LLM 供应商悄悄调高了 max_tokens 的默认值,导致你的 p99 输出长度在一夜之间翻了一倍。那些你没有显式传递的参数,往往就是背后发生变化的配置 —— 本文将介绍如何停止继承那些你无法控制的默认设置。
配额窗口机制重写后,这批夜间脚本是如何拖垮你的交互流量的
一个夜间 LLM 批处理任务稳定运行了 10 个月,直到供应商重写了每日窗口的计算方式——将 00:05 UTC 的 Cron 任务变成了交互式流量的自杀式 429 异常。本文探讨为什么负载隔离、抖动和桶语义契约测试才是结构化的修复方案。
那些与实际限流不符的提供商频率限制响应头
提供商的频率限制响应头与实际限流器往往并不一致 —— 不同的窗口、不同的作用域、不同的单位。本文将探讨这种差异存在的原因,以及如何设计能够应对这种不一致性的控制循环。
重试预算如何从你的仪表板中隐藏了供应商的真实错误率
一个在悄无声息间实现 99.9% 成功率 SLO 的同时导致账单翻了 3 倍的重试循环 —— 为什么重试后的可用性是向领导层报告的错误指标,你应该衡量什么,以及隐藏在可靠性层中的成本-质量调节开关。
导致你的智能体重试机制失效两周的工具 Schema 迁移
为期六周的弃用窗口对每一位人类消费者都运作完美,却让智能体静默失效了整整十四天。本文探讨了重试预算、解析错误和优雅降级为何会交织成一场无人报警的故障,以及捕获这些问题的关键指标。
你的评测套件也是生产负载:当每晚测试耗尽线上流量配额时
当每晚运行的评测套件与线上产品共享同一个供应商组织账号时,一场由“嘈杂邻居”引发的生产事故就不可避免。本文将介绍如何隔离配额、根据 Token 影响对 PR 进行限制,并像对待真正的生产负载一样对待你的评测任务。
那些响应体显示 OK 且被客户端信以为真的 429 错误
当 429 错误的响应体显示为 OK 时,单纯的客户端会信任该响应体,跳过退避算法,从而将频率限制演变成重试风暴导致的宕机。修复方法是结构性的:同时读取状态码、响应头和响应体,并以最严格的声明为准。