·tian
投机解码实战:那顿并非免费的午餐
投机解码如何通过小模型起草 token 并行验证,将 LLM 推理延迟降低 2-3 倍——以及草稿模型选择的数学原理、批处理大小的权衡和生产环境中决定你是获得加速还是减速的那些陷阱。
insider
inference-optimization
speculative-decoding
llm-serving
+1·tian
多模型推理服务的 GPU 显存计算:为什么大多数团队会过度配置 3 倍资源
在并发负载下,主导 GPU 显存的是 KV 缓存而非模型权重。本文将介绍容量规划的精确公式、量化权衡(AWQ vs GPTQ vs GGUF)以及装箱策略,让你在仅够运行 1 个模型的硬件预算下提供 4 个模型的服务。
insider
gpu-inference
llm-serving
quantization
+1