CPU 上的推测解码:借助 DFlash 实现近 4 倍的 ... 笔记

CPU 上的推测解码:借助 DFlash 实现近 4 倍的 Token 生成加速

推测解码可将闲置的 CPU 算力转化为更快的 token 生成速度,同时不改变模型的输出。在我们的 vLLM 测试中,DFlash 在 Intel Xeon 6 平台上使用 Qwen3.5-9B 模型,在并发度为 1 时实现了 3.92 倍的自回归吞吐量提升。我们分析了加速的来源,解释了接受度指标,并展示了推测策略何时能带来收益。