·tian
那些与实际限流不符的提供商频率限制响应头
提供商的频率限制响应头与实际限流器往往并不一致 —— 不同的窗口、不同的作用域、不同的单位。本文将探讨这种差异存在的原因,以及如何设计能够应对这种不一致性的控制循环。
llm-infra
rate-limiting
reliability
observability
+1·tian
微调冷启动:云供应商如何将延迟计入你的闲置成本
托管微调模型与基础模型共享 API 接口,但其成本延迟曲线却大不相同。本文将揭示冷启动税如何隐藏在你的 p99 延迟中,且从未出现在账单上。
llm-infra
fine-tuning
latency
cost
·tian
供应商 99.9% 的 SLA 对你的 Agent 来说衡量边界错了
供应商 99.9% 的可用性是按单次调用衡量的;而你的 Agent 每个任务需要进行 12 次调用。本文将探讨其中的算术逻辑、缺失的合同条款,以及如何在用户察觉之前捕获故障的发散告警。
insider
sla
agents
reliability
+2