Спекулятивное декодирование на... Заметка

Спекулятивное декодирование на ЦП: почти в 4 раза более быстрое создание токенов с DFlash

Спекулятивное декодирование может превратить неиспользуемые вычислительные мощности ЦП в более быстрое создание токенов, не изменяя выходные данные модели. В наших тестах vLLM DFlash обеспечил в 3,92 раза большую пропускную способность авторегрессии с Qwen3.5-9B на Intel Xeon 6 при одновременной работе 1. Мы подробно рассмотрим, откуда берется ускорение, объясним метрики принятия и покажем, что определяет, оправдывает ли спекуляция себя.