AWS DevOps Blog на русском
Подписаться
Автоматизируйте сортировку инцидентов и анализ первопричин SageMaker HyperPod с помощью AWS DevOps Agent
Введение Крупномасштабные рабочие нагрузки машинного обучения: обучение, дообучение и инференс выполняются на кластерах из сотен или тысяч экземпляров GPU в течение дней или недель подряд. Обеспечение операционной видимости такого большого парка машин является постоянной проблемой: события, связанные со здоровьем оборудования, переходы жизненного цикла узлов, колебания емкости и проблемы на уровне рабочих нагрузок появляются в потоке событий вокруг […]