Analytics Vidhya 日本語
フォロー
PagedAttention 対 RadixAttention: LLM KVキャッシュ管理の最適化
現代のLLMは、量子化、プルーニング、蒸留、および高速なアテンションカーネルに依存していますが、本番環境でのパフォーマンスは、多くの場合KVキャッシュ管理に最も依存しています。コンテキストウィンドウが大きくなるにつれて、キャッシュはGPUメモリを大量に消費し、同時実行性、スループット、およびレイテンシを制限します。この課題は2つのブレークスルーによって変革されました。PagedAttentionはメモリ割り当てを改善し、RadixAttentionは効率的なプレフィックスの再利用を可能にします。これら2つの技術を組み合わせることで、[...]