Curvine を使用した Amazon SageMaker HyperPod 上の大規模 LLM 向け階層型 KV キャッシュ
大規模な大規模言語モデル推論の実行は、KVキャッシュのトレードオフを強います。それは、大きすぎるGPUインスタンスか、遅い初回トークン生成時間かのどちらかです。この記事では、Amazon SageMaker HyperPod上に階層化されたKVキャッシュを構築し、キャッシュをCurvineを使用した共有分散NVMeプールに拡張します。これにより、レプリカはコスト効率の高いインスタンス上で、ほぼローカルディスクに近い速度でキャッシュを再利用できます。