速率限制是设计约束,不是错误代码
当 LLM API 速率限制被视为边缘情况而非架构约束时,结果轻则导致无声的成本爆炸,重则造成完全的服务故障。以下是如何设计在持续配额压力下正常运行的系统。
对话感知的速率限制:为什么逐请求限流会破坏多轮 AI
逐请求 API 限流将每次对话轮次视为独立调用,但一个 10 轮的调试会话在架构上是一个完整任务。会话预算、语义去重和优雅降级才是正确的原语——原因如下。
智能体流量不等同于人类流量:为两类调用者设计 API
生产环境的 API 现在正在服务两类调用者——人类和智能体。它们具有不同的流量特征、故障模式和安全风险。在 2026 年,将它们混为一谈是所有关于端点不稳定问题调查的根源。
负载降级是为人类设计的,而 Agent 会放大你正在抵御的风暴
Agent 会围绕 503 错误重新规划并以远超人类的速度重试,将上游的小幅波动演变成关联性停机。本文从实践者视角出发,探讨平台下一步需要的负载降级原语,以及 Agent 为了避免成为“风暴”而必须遵循的纪律。
速率限制层级崩溃:当你的智能体循环产生自我 DoS 时
单个用户的智能体扇出可能会耗尽同一配额下的所有其他用户资源。本文探讨了为什么扁平化的令牌桶在智能体工作负载下会崩溃,以及维持平台公正运行的四层层级结构。
LLM 速率限制是一个分布式系统问题
LLM API 速率限制的行为类似于分布式锁 —— 批处理作业通过饥饿、队头阻塞和优先级反转,静默地使面向用户的流程陷入饥饿,而此时你的错误仪表盘依然显示正常。
多租户 LLM 问题:规模化部署中的嘈杂邻居、隔离与公平性
当数千名用户共享同一模型和向量索引时,一次高消耗的会话会拖慢所有人。本文解释了为何多租户 LLM 基础设施比数据库更难处理——以及真正有效的公平性保障方案。
LLM 流水线中的背压:排队论在基于 Token 的服务中的应用
如何将利特尔法则、准入控制、隔板模式和令牌桶背压应用于 LLM 调用图 —— 以及为什么幼稚的重试逻辑会将供应商的瞬时波动演变成系统停机。
共享 LLM 基础设施中的“吵闹邻居”问题:AI 功能的租户模型
当某个功能的批处理作业耗尽了共享的 API 配额时,付费用户会看到 429 错误。本文将介绍共享 LLM 基础设施的检测信号与隔离模式。
LLM 流水线的背压模式:为何指数退避还不够
四种生产模式——令牌桶队列、优先级通道、感知令牌预算的熔断器和负载卸除——在指数退避让系统陷入持续过载振荡时,让 LLM 流水线保持稳定可靠。