Amazon SageMaker HyperPod は、推論のオートスケーリングを高速化し、コールドスタートを削減するために、モデルキャッシングをサポートするようになりました。
Amazon SageMaker HyperPod がモデルキャッシングをサポートするようになりました。これは、モデルの重みとコンテナイメージをクラスターノードに事前にロードすることで、ポッドの起動時間を数分から数秒に短縮する推論最適化です。チャットアシスタント、エージェントパイプライン、RAG、ドキュメント分析などのワークロードで大規模な LLM 推論を実行する場合、コールドスタートは深刻なボトルネックとなります。デプロイメントやスケールアウトイベントでは、コンテナイメージとモデルの重みのダウンロードに最も時間がかかります。モデルサイズが大きくなるにつれて、この問題は悪化し、大規模なモデルではトラフィックを提供できるようになるまでに数十分かかることもあります。モデルキャッシングは、2 つの独立した機能でこの問題を解決します。ウェイトキャッシュは、S3 または FSx からネットワーク経由でプルするのではなく、ローカル NVMe にモデルの重みを保存するため、ポッドは高速なローカルストレージから読み取ります。イメージキャッシュは、コンテナイメージを事前にプルするため、ポッドは ECR のダウンロードを完全にスキップします。ポッドがウォームキャッシュのないノードに着地した場合、元のソースからのプルに自動的にフォールバックするため、ポッドがスタックしたり失敗したりするリスクはありません。57 GB から 145 GB のモデルでのベンチマークでは、スケールアウトが約 60% 高速化し、イメージキャッシュは 2 分以上のイメージプル時間を削減 (97% 削減) します。このメリットはモデルサイズとともに増加し、元のソースパスの信頼性を維持します。お客様は、InferenceEndpointConfig または JumpStartModel リソースに modelCacheConfig セクションを追加することで、HyperPod Inference Operator を介してモデルキャッシングを有効にできます。オペレーターは、手動でのセットアップやクリーンアップなしに、ライフサイクル全体を処理します。モデルキャッシングは、SageMaker HyperPod が利用可能なすべてのリージョンで一般提供が開始されました。開始するには、SageMaker HyperPod のドキュメントを参照してください。