PagedAttention 대 RadixAttentio... 노트

PagedAttention 대 RadixAttention: LLM KV 캐시 관리 최적화

현대의 LLM은 양자화, 가지치기, 증류, 그리고 더 빠른 어텐션 커널에 의존하지만, 프로덕션 성능은 종종 KV 캐시 관리에 가장 크게 좌우됩니다. 컨텍스트 창이 커짐에 따라 캐시는 상당한 GPU 메모리를 소비하여 동시성, 처리량 및 지연 시간을 제한합니다. 두 가지 혁신적인 기술이 이 과제를 해결했습니다. PagedAttention은 메모리 할당을 개선하고, RadixAttention은 효율적인 접두사 재사용을 가능하게 합니다. 이 기술들이 함께 […]