CPUにおける推論的デコーディング:DFlashによるトーク... ノート

CPUにおける推論的デコーディング:DFlashによるトークン生成速度の約4倍向上

Speculative decodingは、モデルの出力を変更することなく、未使用のCPU計算能力をより高速なトークン生成に変換できます。vLLMのテストでは、DFlashはIntel Xeon 6で、同時実行数1においてQwen3.5-9Bで3.92倍の自己回帰スループットを実現しました。速度向上の要因、受け入れ指標の説明、そして推測が効果的かどうかを決定する要因を示します。