AWS DevOps Blog 日本語
フォロー
AWS DevOps Agent による SageMaker HyperPod インシデントトリアージと根本原因分析の自動化
はじめに 大規模な機械学習ワークロード:トレーニング、ファインチューニング、推論は、数百から数千のGPUインスタンスのクラスターで、数日から数週間にわたって実行されます。この規模のフリート全体で運用上の可視性を維持することは、常に課題です。ハードウェアの正常性イベント、ノードのライフサイクル遷移、容量の変動、ワークロードレベルの問題が、イベントストリームの周りに現れます […]