你的 Agent 链路中无人分配的延迟预算
Agent 的 SLO 通常设置在边界处,而内部却缺乏预算分配,导致没人能归因是哪一跳搞砸了 P99。你需要分配逐跳预算,在 Span 级别进行追踪,并约束那个呈乘性而非加性增长的尾部延迟。
P99 是产品决策,而非基建决策
你的尾部延迟目标并不是基建团队单纯优化出的一个数字 —— 这个数字本身就是一个产品选择。本文探讨了 UX 交互设计与延迟预算如何相互权衡,以及为什么 P99 应该出现在设计评审中。
护栏税:当安全分类器让你的延迟和账单翻倍时
外挂式安全分类器堆叠在关键路径中,使延迟增加三倍并推高了你的推理账单。本文介绍如何根据爆炸半径调整护栏规模,并采用并发而非串行的方式运行它们。
思维的 p99:当模型决定你的请求耗时多久
推理模型使响应时间成为问题难度的函数,导致 p99 延迟激增至 p50 的 3-5 倍,超时调整也演变为成本问题。通过针对更小模型的对冲请求、按路由设置的推理开销上限以及感知难度的 SLO,可以将尾部延迟控制在合理范围内。
当往返时延成为 Bug :你一直在忽略的端侧推理必要性
延迟、成本和隐私的考量正在悄然转向,反对云端往返 —— 以及决定每个查询实际运行位置的单次请求路由模式。
GPU 调度是一个排队问题,而不是资源配置问题
LLM 终端响应慢通常是排队失败,而非硬件短缺。了解连续批处理、KV 缓存限制以及 Prefill/Decode 调度如何决定你的尾部延迟 —— 以及为什么增加 GPU 无法解决此问题。
你的 AI 功能无法使用 CDN 边缘缓存,因为响应因用户而异
个性化 AI 功能继承了与缓存网页不同的物理特性。你的团队从 CDN 支持的界面借鉴的延迟 SLO,对于按用户生成的响应来说,在结构上是无法实现的 —— 以及你应该如何应对。
微调冷启动:云供应商如何将延迟计入你的闲置成本
托管微调模型与基础模型共享 API 接口,但其成本延迟曲线却大不相同。本文将揭示冷启动税如何隐藏在你的 p99 延迟中,且从未出现在账单上。
你增加的 Reranker:对召回率的拖累超过了对精准度的提升
离线 nDCG 显示你的交叉编码器 Reranker 提升了四个点。但生产环境的 p99 指标显示这是一次倒退。评估标准从未对截止时间、批处理窗口或超时引起的回退路径进行建模 —— 而这个差距正是精准度提升消失的地方。
语音代理 SLO 定义为首个音频时间,而你的服务商则以首个 Token 时间衡量
基于 LLM 的首个 Token 时间(TTFT)构建的语音代理延迟 SLO 看起来是绿色的,但用户却听到了 600 毫秒的间隙。该 SLO 存在于错误的层级;用户的耳朵才是真正关键的边界。
你定义‘首个 Token’的位置决定了你的延迟 SLO 是否真实
p99 首个 Token 延迟低于 800 毫秒看起来像是一个承诺——直到推理层的切换悄然重新定义了‘首个 Token’的含义。SLO 衡量的是供应商边界;而用户的感受则完全不同。
Agent 循环从搜索框偷走的延迟预算
将 200 毫秒的搜索调用换成 4 秒的 Agent 循环,延迟预算并没有消失 —— 它从基础设施迁移到了 UX。如果团队没有捕捉到这种交接,就会在交付一个指标更好但实际体验更差的产品。