LLM-as-Judge 漂移:当你的评估器升级导致所有数据变动时
如果回归测试套件在没有任何提示词更改的情况下变红,通常问题出在裁判身上,而不是候选模型。本文探讨评估器漂移如何制造虚假的胜负,为什么固定裁判和校准频率至关重要,以及在评估元数据中应记录哪些内容以防止仪表盘数据误导。
你的 LLM Span 在撒谎:APM 工具没告诉你的推理延迟真相
标准的 APM 工具将 LLM 调用视为一个不透明的 span —— 但 prefill、decode、缓存未命中和批处理位置都隐藏在这个耗时段中。本文将揭示你真正需要的追踪层面。
评估通过,但工具全是 Mock 的:为什么你的 Agent 最棘手的生产故障从未进入测试框架
Mock 工具的评估让 CI 绿灯常亮,而生产环境却在一团糟。本文探讨了每个 Mock 默认做出的三个隐含假设,为什么评估通过率与事故率会发生背离,以及最终弥合这一差距的三级阶梯(Mock、录制回放、实时烟雾测试)。
模型账单仅占你推理成本的 30%
Token 支出仅仅是六项预算中的一项。通过对检索、可观测性、重试和人工审核的真实拆解,我们将揭示为什么通过更换模型来实现的成本节省往往并不真实。
“规划并执行”只是营销而非契约:将计划依从度作为一等 SLI
“规划并执行”智能体生成的计划看起来像契约,但在实际表现中更像是预测。你应该将计划依从度视为一项 SLI,具备测量、强制执行和有限的重新规划预算,而不是一个每季度评分一次、可有可无的质量指标。
速率限制层级崩溃:当你的智能体循环产生自我 DoS 时
单个用户的智能体扇出可能会耗尽同一配额下的所有其他用户资源。本文探讨了为什么扁平化的令牌桶在智能体工作负载下会崩溃,以及维持平台公正运行的四层层级结构。
重试放大:2% 的工具错误率如何演变成 20% 的智能体故障
智能体循环通过在多个步骤和 SDK 层级间叠加重试,将 2% 的工具错误率放大为 20% 的用户端故障。本文将解析其背后的数学原理、自我 DoS 模式,以及能够遏制这种现象的重试预算规范。
Agent Trace 中的采样偏差:为什么你的调试数据集在悄悄排除你最关心的失败案例
头部采样和均匀随机采样会悄悄地从你的调试语料库中切除罕见的灾难性 Agent 轨迹。通过尾部采样、基于异常的关键保留以及按故障模式划分的蓄水池,可以构建一个真正包含你所需失败案例的调试数据集。
Token 消耗是你的 SOC 尚未监控的安全信号
异常的 LLM Token 消耗是 API Key 被盗、提示词注入或数据外泄的最早信号 —— 但目前看板归财务管,响应归安全管。本文将介绍如何将两者打通。
首字延迟 (TTFT) 是你尚未监测的延迟 SLO
p50 和 p99 的总延迟忽略了一个决定你 AI 产品体验的关键指标:首字延迟 (TTFT)。本文将探讨为什么推理模型会让情况变得更糟、需要衡量哪些指标,以及如何通过路由策略来优化它。
AI 审计追踪是产品功能,而非合规勾选项
向用户展示你的 AI 智能体实际做了什么——调用了哪些工具、检索了哪些数据、在何处产生了分支——比任何功能开关实验都能更可靠地提高采用率。以下是构建方法。
AI 功能生命周期衰减问题:如何在用户发现之前捕捉到性能下降
91% 的机器学习模型会随时间降级,但大多数团队只会在用户投诉后才发现。以下是如何在分布偏移演变为危机之前,对你的 AI 功能进行监控。