CPU에서의 추론적 디코딩: DFlash로 거의 4배 빠른 토큰 생성
Speculative decoding는 모델의 출력을 변경하지 않고도 사용되지 않는 CPU 연산을 더 빠른 토큰 생성으로 전환할 수 있습니다. vLLM 테스트에서 DFlash는 Intel Xeon 6에서 Qwen3.5-9B를 사용하여 동시성 1에서 3.92배의 자기회귀 처리량을 제공했습니다. 우리는 속도 향상이 어디에서 오는지 분석하고, 수락 지표를 설명하며, 추측이 성과를 내는지 여부를 결정하는 요소를 보여줍니다.