工具重入:你的函数调用层尚未察觉的 Bug 类别
函数调用层默认采用“即发即弃”模式,既没有调用栈也没有环路检测器——其代价体现在随着工具库的增长,单个请求的 Token 消耗量会不断攀升。
工具 Schema 是提示词,而非 API 合约
从 OpenAPI 规范自动生成的 LLM 工具 Schema,本质上是将你的 API 文档作为提示词发布 —— 而你的智能体将为此付出代价,在测试中难以察觉的误用会频频发生。
翻译并非本地化:多语言 AI 正面临的文化校准债务违约
仅仅发布翻译后的提示词和评估集并不等同于多语言产品的上线。失败的模式往往是文化层面的,而非语言层面的,且你的仪表盘无法识别这些风险。
两个 PM 的难题:当提示词所有权与产品所有权发生偏离时
大多数 AI 团队将提示词所有权与产品所有权分开,并在无人负责的回归问题中支付协调税。本文介绍了这种失败模式以及让这种分工得以存续的仪式——共享发布日历、统一仪表板、联合事故频道以及包含四个产出物的 RACI 模型。
你的向量数据库也有热点 Key:为什么 ANN 索引在生产成本上“撒了谎”
公开的 ANN 基准测试通常运行均匀的查询负载,但在生产环境中检索是齐夫分布(Zipfian)的 —— 这种差异表现为分片过载、RAM 浪费以及超出预期的 p99 延迟。
方差正在吞噬实验:为什么传统的 A/B 测试功效计算不适用于 LLM 功能
经典的 A/B 测试数学模型假设每个用户的行为是确定的。LLM 功能两次打破了这一假设,导致标准的样本量模板在两个方向上都给出了错误的判断 —— 本文介绍了修复这一问题的四个转变。
智能体完成任务时房间已空:异步后台任务中的过时上下文交付
延迟 90 秒完成任务的异步智能体往往会交付用户已经不再关心的答案。解决方法在于“交付时相关性网关”,而非更快的模型。
Agent 飞行记录仪:在第一次事故发生前必须捕获的字段
当 Agent 脱轨时,大多数团队拥有的取证记录都是徒劳的。这里列出了飞行记录仪在第一次事故发生前必须捕获的字段,以及与之配套的存储、采样和隐私规范。
智能体记忆漂移:为什么一致性对齐是你缺失的关键环
长期运行的智能体在停止观察的那一刻起就与世界脱节。应将记忆视为数据库副本:使用水位线 (watermarks)、变更摘要 (change feeds) 和惰性重校验。
无真值情况下的智能体 SLO:为无法实时评分的输出建立错误预算
传统的 SRE 实践为你提供了与用户满意度直接挂钩的可用性和延迟目标。但智能体(Agentic)特性打破了这种映射。本文将介绍当“成功”在请求发出数小时后才出现时,该如何编写错误预算——以及为什么照搬延迟 SLO 手册的团队虽然能完成每个季度的目标,却眼睁睁看着用户流失。
30 秒都去哪了:APM 无法察觉的 Agent 步骤内部延迟归因
传统的 APM 将 Agent 的一个步骤视为单一的粗粒度 Span,导致值班工程师只能靠猜。通过将其分解为七个阶段,区分首字延迟 (Prefill) 与解码 (Decode),并追踪关键路径而非总 Span 时间。
Agent 撤销按钮是 Saga,而非栈
多工具 Agent 撤销本质上是一个伪装的 Saga 模式问题。预计算逆操作、残留 UX 和级联限制决定了撤销是会成功,还是会在 40% 的情况下静默失败。