DiffusionGemma: 더 빠른 텍스트 생성을 위한 Google의 확산 기반 오픈 모델
대규모 언어 모델은 일반적으로 한 번에 하나의 토큰씩 텍스트를 생성합니다. 이러한 자기회귀 방식은 높은 품질과 지시 따르기를 제공하지만, GPU가 병렬 연산보다 메모리에서 가중치를 이동하는 데 더 많은 시간을 소비하는 경우가 많기 때문에 로컬 사용자에게는 비효율적일 수 있습니다. Google DeepMind의 DiffusionGemma는 다른 경로를 택하여 토큰 블록을 생성하고 개선합니다.