两个模型对同一结构化输出 Schema 的不同理解
两个大模型供应商可能都遵循同一个 JSON Schema,但生成的输出却无法互换 —— 这种差异通常在你第一次触发备选路由时显现。
教会你的智能体识别评估的合成评估
当你的合成评估生成器带有特征指纹时,你的模型会学到它 —— 结果就是评分上升而生产环境的质量却停滞不前。要把 “评估识别” 视为一个奖励作弊问题,而不是覆盖范围问题。
增长速度快于评估套件的系统提示词
系统提示词随着规则逐条增加,而评估套件则随着事故逐个增加 —— 这种不对称性悄然让 “评估通过” 变成了一个谎言。本文将介绍如何让这两个层面协同演进。
误将假期低谷视为新基线的 Token 预测
落在假期低谷的四周滚动窗口,会导致在进入新季度的第一天就让 Token 预算崩溃。本文将探讨为什么 LLM 支出预测呈现的是消费者需求而非基础架构成本的形态,以及通过同比基线叠加、日历叠加和残差反馈循环,让容量规划在日历周期中维持稳健。
你的供应商通过更小的分块达成的 Tokens-Per-Second SLO
你的供应商通过缩小分块达到了每秒 Token 数的 SLA,但你的渲染器却为此付出了代价。为什么流式吞吐量是一个需要协同设计的属性 —— 以及如何编写一个由消费者主导的感官 SLO。
当源数据已更改,你的 Prompt 缓存仍在提供旧的工具执行结果
Prompt 缓存将易变的工具结果转化为你与模型提供商之间的一项隐藏 TTL 契约。当缓存 TTL 的生命周期超过了数据的有效期时,你的 Agent 就会在享受缓存命中率的同时,自信地提供“昨天的真相”。
由客户端时钟而非网关标记时间戳的链路追踪时间线
在你的 Agent 链路中,浏览器标记的 Span 与网关标记的 Span 是不可比的。本文探讨为什么客户端时钟会“撒谎”、SDK 是如何传播这一偏差的,以及缩小差距的几种模式。
语音代理 SLO 定义为首个音频时间,而你的服务商则以首个 Token 时间衡量
基于 LLM 的首个 Token 时间(TTFT)构建的语音代理延迟 SLO 看起来是绿色的,但用户却听到了 600 毫秒的间隙。该 SLO 存在于错误的层级;用户的耳朵才是真正关键的边界。
即使你发誓绝不分享,你的评估集仍需要的水印
私有评估集会像其他任何东西一样泄露 —— 通过 Bug 票据、Slack 粘贴、供应商流水线和调试日志。请为它们添加水印,以便在下一次模型升级到来时,你能分辨出真实的性能提升与污染造成的假象。
你定义‘首个 Token’的位置决定了你的延迟 SLO 是否真实
p99 首个 Token 延迟低于 800 毫秒看起来像是一个承诺——直到推理层的切换悄然重新定义了‘首个 Token’的含义。SLO 衡量的是供应商边界;而用户的感受则完全不同。
你的编程智能体忘记检查的分支状态
编程智能体基于 Git 状态快照进行推理,而该快照往往会悄无声息地失效。Worktrees、turn-preludes、分支锚定以及快照恢复技术能将这种无声的漂移转化为明确的信号。
被切分边界拦腰截断的关键句,以及随之消失的答案
固定大小的 Token 切分会将关键子句拦腰切断,导致碎片化的片段无法被单独检索。本文探讨了为什么这种失败在标准评估中难以察觉,以及哪些切分策略能真正解决这一问题。