Posts tagged "gpu-serving" on TianPan.co.
查看所有标签
稀疏 MoE 模型所需的 GPU 显存是其激活参数量的 8.6 倍,且表现出稠密模型监控容易忽略的延迟波动,并打破了朴素的批处理假设。本文将深入分析基准测试中经常忽略的服务端细节。