Amazon SageMaker HyperPod тепе... Заметка

Amazon SageMaker HyperPod теперь поддерживает глубокие проверки работоспособности для кластеров Slurm с непрерывным предоставлением ресурсов.

Amazon SageMaker HyperPod теперь поддерживает глубокие проверки работоспособности для кластеров, управляемых Slurm и созданных с помощью непрерывного предоставления ресурсов. Это позволяет вам проактивно проверять работоспособность GPU-ускорителей на работающих экземплярах в любое время. Непрерывное предоставление ресурсов позволяет быстро начать обучение и асинхронно масштабировать группы экземпляров без сбоев типа "все или ничего", а теперь вы можете сочетать эту гибкость с комплексной проверкой оборудования по мере появления экземпляров. Эта возможность решает критическую проблему, когда даже один неисправный узел может привести к потере часов вычислительного времени и задержке критически важных рабочих нагрузок. С помощью глубоких проверок работоспособности вы можете выбрать целые группы экземпляров или отдельные экземпляры для выполнения комплексных тестов на прочность оборудования и тестов на подключение перед выделением вычислительных ресурсов для задания. Поскольку непрерывное предоставление ресурсов асинхронно добавляет рабочие узлы в ваш кластер Slurm по мере доступности ресурсов, вы можете выполнять глубокие проверки работоспособности каждого нового узла по мере его появления, проверяя оборудование перед планированием заданий на нем и не прерывая рабочие нагрузки, уже выполняющиеся на исправных узлах. Ход выполнения и результаты видны как на уровне группы экземпляров, так и на уровне экземпляра через консоль SageMaker и API, обеспечивая полную видимость состояния GPU, сетевого подключения и производительности многоузловой связи. Экземпляры, проходящие проверки, автоматически изолируются от планирования рабочих нагрузок и возвращаются в эксплуатацию после успешного прохождения. В сочетании с возможностью автоматического восстановления узлов HyperPod, экземпляры, которые не прошли проверку, автоматически перезагружаются или заменяются, обеспечивая работоспособность кластера. Эта возможность доступна во всех регионах, где доступен Amazon SageMaker HyperPod. Чтобы узнать больше о глубоких проверках работоспособности по запросу и непрерывном предоставлении ресурсов, обратитесь к руководству пользователя Amazon SageMaker HyperPod.