Towards Data Science | Medium 日本語 フォロー CPUにおける推論的デコーディング:DFlashによるトークン生成速度の約4倍向上 Speculative decodingは、モデルの出力を変更することなく、未使用のCPU計算能力をより高速なトークン生成に変換できます。vLLMのテストでは、DFlashはIntel Xeon 6で、同時実行数1においてQwen3.5-9Bで3.92倍の自己回帰スループットを実現しました。速度向上の要因、受け入れ指標の説明、そして推測が効果的かどうかを決定する要因を示します。 Speculative Decoding on CPUs: Nearly 4x Faster Token Generation with DFlash towardsdatascience.com Towards Data Science | Medium 日本語 RSS thenote.app