·tian
多租户 LLM 推理中的调度公平性:为什么 FIFO 是错误的默认选择
当多个团队共享 LLM 推理基础设施时,朴素的 FIFO 调度会导致优先级反转和 SLO 违规。以下是生产环境中公平调度的真实面貌。
insider
llm
infrastructure
mlops
+1·tian
GPU 饥饿:某个租户的推理提示词如何导致你的共享推理端点停滞
一个推理提示词就能拖慢共享推理端点上所有其他请求的 p99 延迟。本文将探讨为什么连续批处理和 KV 缓存钉选会导致队头阻塞,分析鲜有人关注的诊断信号,并介绍四种缓解方案 —— 分块预填充、优先级调度、每租户 Token 上限以及请求类别隔离 —— 按其侵入性由低到高排序。
insider
llm-inference
gpu
multi-tenant
+2·tian
持续批处理:LLM 服务中提升 GPU 利用率的最关键技术
深入探讨迭代级调度如何取代静态批处理,在生产环境的 LLM 服务中实现 4–8 倍的 GPU 吞吐量提升,以及在高并发场景下出现的失效模式。
insider
llm-inference
gpu
serving
+2