Автоматизируйте сортировку инц... Заметка
AWS DevOps Blog на русском

Автоматизируйте сортировку инцидентов и анализ первопричин SageMaker HyperPod с помощью AWS DevOps Agent

Введение Крупномасштабные рабочие нагрузки машинного обучения: обучение, дообучение и инференс выполняются на кластерах из сотен или тысяч экземпляров GPU в течение дней или недель подряд. Обеспечение операционной видимости такого большого парка машин является постоянной проблемой: события, связанные со здоровьем оборудования, переходы жизненного цикла узлов, колебания емкости и проблемы на уровне рабочих нагрузок появляются в потоке событий вокруг […]
CdXz5zHNQW_lm5OHTZgt1.jpeg