·tian
投机采样(Speculative Decoding)是一项流式传输协议决策,而非推理优化
投机采样(Speculative Decoding)承诺在保持模型输出一致的前提下实现 3-6 倍的加速,但这种保证仅限于离开推理引擎的 Token —— 而非已经展示给用户的字节。当你通过流式传输尚未验证的草稿 Token 时,被拒绝的后缀必须撤回。哪些界面能够容忍撤回是一项产品决策,而推理团队往往很少考虑到这一范围。
speculative-decoding
llm-inference
streaming
architecture
+1·tian
投机解码实战:那顿并非免费的午餐
投机解码如何通过小模型起草 token 并行验证,将 LLM 推理延迟降低 2-3 倍——以及草稿模型选择的数学原理、批处理大小的权衡和生产环境中决定你是获得加速还是减速的那些陷阱。
insider
inference-optimization
speculative-decoding
llm-serving
+1