你从未进行过压测的每分钟 Token 上限
供应商的速率限制是你无法控制的每分钟 Token 预算 —— 而产品发布则是发现这一上限的最糟糕时机。本文将介绍如何在 429 错误发生前进行预测、压测并预留缓冲空间。
为 Agent 进行容量规划:为什么并发数而非 QPS 才是你的真实衡量单位
QPS 会掩盖 Agent 的真实负载,因为运行过程会持续数分钟并产生扇出效应。使用利特尔法则(Little's Law)来按并发数进行估算——这才是真正占用你资源的指标。
你的延迟 SLO 取决于其他团队的 Prompt 大小
共享的每分钟 Token 数(TPM)限制使得你的延迟 SLO 与你自己的服务脱钩。解决方法是以提供商进行限流的单位来衡量内部容量,而不是以请求数或美元。
误将假期低谷视为新基线的 Token 预测
落在假期低谷的四周滚动窗口,会导致在进入新季度的第一天就让 Token 预算崩溃。本文将探讨为什么 LLM 支出预测呈现的是消费者需求而非基础架构成本的形态,以及通过同比基线叠加、日历叠加和残差反馈循环,让容量规划在日历周期中维持稳健。
供应商速率限制是你从未编写过的容量计划
当你的应用遇到 429 错误时,随后运行的重试代码便悄然成为了你的容量策略。应将速率限制处理视为有意识的负载脱落——包含优先级层级、抖动和调度器——而非无人审核的库默认设置。
当每个请求的思考成本各不相同时的容量规划
智能体请求的成本并不稳定 —— 一个请求可能只需 200 个 Token 就能解决,而下一个请求可能会耗费 100 万个。为什么 p50 预测在智能体工作负载中会失效,以及如何改为基于 Token 和工具调用分布进行规划。
GPU 算力是产品路线图的约束:决定第三季度的 18 个月合同
多年期 GPU 承诺悄然将产品路线图与那些从未见过功能列表的人所做的容量决策绑定在一起。这里是弥合这一差距的规划准则。
Agent 循环容量计算:为什么你的预置吞吐量只有你想象的一半
基于用户 QPS 估算的预置吞吐量往往会因为循环扇出因子而导致 Agent 产品资源配置不足。应改为基于模型调用率、循环深度和突发尾部延迟进行规划。
仪表盘视为噪点的周一早晨 AI 性能下降
大多数 AI 功能仪表盘通过取平均值抹平了一种导致真金白银损失的故障模式 —— 这种每周循环的性能下降,只有当你按小时维度拆解延迟、缓存命中率和重试次数时才会显现。
推理成本预测:财务团队想要而你写不出来的容量规划
经典的容量规划假设工作负载是可衡量的,且单位成本是稳定的。AI 工作负载打破了这两点——你交给财务部门的 SaaS 风格预测,正是他们不断要求重新调整基准的原因。本文介绍了它应该采取的四项 FinOps 准则。
AI 推理的突发容量规划:当黑色星期五遇上你的 KV Cache
AI 推理负载对流量峰值的响应与传统 API 截然不同——冷 KV Cache、长达数分钟的冷启动、受内存限制的并发,使得响应式自动扩缩容方案完全失效。本文介绍实用的容量规划计算方法、预热策略,以及真正有效的优雅降级模式。
LLM 排队论:为什么你的负载均衡器按请求思考,而你的 GPU 按 Token 思考
将利特尔法则、优先级队列和准入控制应用于基于 Token 的 LLM 推理工作负载——探讨为什么请求级负载均衡会失效,工作保留调度器如何释放额外 30-70% 的 GPU 吞吐量,以及防止生产环境意外的容量规划数学。