生产级智能体的 90 秒冷启动:当 LLM 不再是瓶颈时
生产级智能体在模型运行之前,通常需要 60 到 120 秒进行冷启动。解决方案不在于更快的 TTFT — 而在于将冷启动延迟视为一级 SLO,并通过预热池、快照/恢复、工具延迟加载以及 CI 门禁来进行优化。
智能体管道中的并行陷阱:扇出为何让延迟更糟
拆分出并行子智能体看起来是显而易见的提速方案,但隐藏的协调开销——上下文合并、去重、错误聚合——会让 p99 延迟变得更糟,即便 p50 有所改善。
你的 LLM 网关缺少的长尾容错重试策略
将微服务默认的重试机制应用于 8 秒的 LLM 调用,会显著拉高 P99 延迟,在供应商故障期间白白消耗 Token,并掩盖一个用户可见的延迟悬崖,而网关仪表盘对此却毫无察觉。
多步 Agent 的延迟预算:为什么 P50 会说谎,而 P99 才是用户的真实感受
多步 Agent 在中位数延迟上看起来很快,但在尾部延迟上却让人感觉很慢。本文将探讨为什么系统组合会惩罚 P50 仪表板,以及如何设计符合用户实际体验的延迟预算。
拒绝延迟税:为什么分层护栏会侵蚀你的 p95 延迟预算
分层安全流水线在长尾效应下会悄然使 p95 延迟和成本增加三倍。应将护栏视为一种受预算限制的资源,通过分层分类器、并行检查和诚实的延迟契约来进行管理。
下午 3 点和凌晨 3 点的同一个 Prompt 并不是同一个 Prompt:LLM 评估中的昼夜漂移
LLM 调用的行为取决于挂钟时间 —— 批次大小、缓存状态和路由层级会随着供应商负载而变化。凌晨 2 点运行的评估是在生产环境永远不会遇到的条件下进行校准的。这里有五个实践,可以缩小非高峰期评估与高峰期现实之间的差距。
30 秒都去哪了:APM 无法察觉的 Agent 步骤内部延迟归因
传统的 APM 将 Agent 的一个步骤视为单一的粗粒度 Span,导致值班工程师只能靠猜。通过将其分解为七个阶段,区分首字延迟 (Prefill) 与解码 (Decode),并追踪关键路径而非总 Span 时间。
评测环境的延迟谎言:为什么你的 p95 在生产环境中翻倍
评测套件测量的是在一台安静机器上针对热缓存进行的串行调用;生产环境则是另一回事。将延迟视为部署的属性,而非模型的属性,否则你的 p95 数据将会具有误导性。
Token 间抖动:你的 p95 仪表盘看不见的流式传输 UX 失败
首个 Token 响应时间 (TTFT) 和总生成时间都符合 SLO,但用户却抱怨 AI 在响应过程中『卡住了』。你的仪表盘所隐藏的指标是相邻 Token 之间的间隔 —— 而平滑这一间隔是一个 UX 问题,而非吞吐量问题。
为什么你的语音智能体显得很没礼貌:话轮转换是你从未记录过的延迟预算
为什么语音智能体显得很没礼貌:解析四阶段延迟预算、混合话轮检测、全双工音频以及保护状态的抢占协议。
GPU 饥饿:某个租户的推理提示词如何导致你的共享推理端点停滞
一个推理提示词就能拖慢共享推理端点上所有其他请求的 p99 延迟。本文将探讨为什么连续批处理和 KV 缓存钉选会导致队头阻塞,分析鲜有人关注的诊断信号,并介绍四种缓解方案 —— 分块预填充、优先级调度、每租户 Token 上限以及请求类别隔离 —— 按其侵入性由低到高排序。
你的 P99 正在受陌生人流量的影响:托管 LLM 推理中的“吵闹邻居税”
托管 LLM API 在你从未见过的租户之间共享 GPU、批处理和 KV 缓存预算,因此你的尾部延迟会随陌生人的流量而波动。本文将介绍如何证明这一点、如何缓解,以及何时决定转向专用算力。