·tian
你从未进行过压测的每分钟 Token 上限
供应商的速率限制是你无法控制的每分钟 Token 预算 —— 而产品发布则是发现这一上限的最糟糕时机。本文将介绍如何在 429 错误发生前进行预测、压测并预留缓冲空间。
llm
capacity-planning
rate-limits
reliability
+1·tian
配额窗口机制重写后,这批夜间脚本是如何拖垮你的交互流量的
一个夜间 LLM 批处理任务稳定运行了 10 个月,直到供应商重写了每日窗口的计算方式——将 00:05 UTC 的 Cron 任务变成了交互式流量的自杀式 429 异常。本文探讨为什么负载隔离、抖动和桶语义契约测试才是结构化的修复方案。
insider
rate-limits
llm-ops
reliability
+1·tian
你的评测套件也是生产负载:当每晚测试耗尽线上流量配额时
当每晚运行的评测套件与线上产品共享同一个供应商组织账号时,一场由“嘈杂邻居”引发的生产事故就不可避免。本文将介绍如何隔离配额、根据 Token 影响对 PR 进行限制,并像对待真正的生产负载一样对待你的评测任务。
llm-ops
evaluation
rate-limits
reliability
+1·tian
供应商配额在你的全球流量从未选中的时区重置
供应商配额按照供应商的时间重置,而不是客户的时间。当周期的临界结束点与你的流量峰值时区重叠时,429 错误看起来就像是随机噪声 —— 而 UTC 仪表板掩盖了背后的真相。
insider
llm-ops
rate-limits
observability
+2