Amazon SageMaker HyperPod は、継続的なプロビジョニングを伴う Slurm クラスター向けのディープヘルスチェックをサポートするようになりました。
Amazon SageMaker HyperPod は、継続的プロビジョニングで作成された Slurm オーケストレーションクラスタに対して、ディープヘルスチェックをサポートするようになりました。これにより、実行中のインスタンスの GPU アクセラレータの健全性をいつでもプロアクティブに検証できます。継続的プロビジョニングにより、トレーニングを迅速に開始し、すべてか無かの失敗なしにインスタンスグループを非同期にスケーリングできます。この柔軟性と包括的なハードウェア検証を、インスタンスがオンラインになったときに組み合わせることができます。この機能は、単一の正常でないノードでさえ、数時間のコンピューティング時間を無駄にし、重要なワークロードを遅延させる可能性があるという重要な課題に対処します。ディープヘルスチェックを使用すると、インスタンスグループ全体または特定のインスタンスを対象に、ジョブにコンピューティングリソースを割り当てる前に、包括的なハードウェアストレス テストと接続テストを実行できます。継続的プロビジョニングは、容量が利用可能になったときにワーカーノードを Slurm クラスタに非同期に追加するため、各新しいノードがオンラインになったときにディープヘルスチェックを実行し、ジョブをスケジュールする前にハードウェアを検証し、正常なノードで既に実行されているワークロードを中断することなく行うことができます。進捗状況と結果は、SageMaker コンソールと API を通じて、インスタンスグループとインスタンスレベルの両方で表示され、GPU の健全性、ネットワーク接続、およびマルチノード通信パフォーマンスに関する完全な可視性を提供します。チェック中のインスタンスは、ワークロードのスケジュールから自動的に分離され、合格するとサービスに戻されます。HyperPod の自動ノードリカバリ機能と組み合わせると、失敗したインスタンスは自動的に再起動または交換され、クラスタの健全性が保証されます。この機能は、Amazon SageMaker HyperPod が利用可能なすべてのリージョンで利用できます。オンデマンドのディープヘルスチェックと継続的プロビジョニングの詳細については、Amazon SageMaker HyperPod ユーザーガイドを参照してください。