·tian
生产环境下的自托管 LLM:没人告诉你的 GPU 显存计算公式
生产环境下的自托管 LLM GPU 显存规划几乎总是出错,因为团队往往只根据模型权重估算而忽略了 KV 缓存。本文将详细解析其中的计算逻辑、INT4/FP8/FP16 之间的量化权衡、推理框架选择,以及从云端 API 转向自托管的真实盈亏平衡计算。
insider
llm-inference
self-hosting
gpu
+2·tian
持续批处理:LLM 服务中提升 GPU 利用率的最关键技术
深入探讨迭代级调度如何取代静态批处理,在生产环境的 LLM 服务中实现 4–8 倍的 GPU 吞吐量提升,以及在高并发场景下出现的失效模式。
insider
llm-inference
gpu
serving
+2