Amazon SageMaker HyperPod가 지속적인 프로비저닝을 통해 Slurm 클러스터에 대한 심층적인 상태 점검을 지원합니다.
Amazon SageMaker HyperPod가 이제 지속적 프로비저닝으로 생성된 Slurm 오케스트레이션 클러스터에 대한 심층 상태 점검을 지원하여, 실행 중인 인스턴스의 GPU 가속기 상태를 언제든지 사전에 확인할 수 있습니다. 지속적 프로비저닝을 사용하면 모든 것이 실패하거나 아무것도 실패하지 않는 상황 없이, 훈련을 빠르게 시작하고 인스턴스 그룹을 비동기적으로 확장할 수 있으며, 이제 인스턴스가 온라인 상태가 될 때 포괄적인 하드웨어 검증과 함께 이러한 유연성을 활용할 수 있습니다. 이 기능은 단일 비정상 노드조차도 몇 시간의 컴퓨팅 시간을 낭비하고 중요한 워크로드를 지연시킬 수 있는 중요한 문제를 해결합니다. 심층 상태 점검을 통해 전체 인스턴스 그룹 또는 특정 인스턴스를 대상으로 포괄적인 하드웨어 스트레스 테스트 및 연결 테스트를 실행한 후 작업을 위해 컴퓨팅 리소스를 할당할 수 있습니다. 지속적 프로비저닝은 용량이 확보되는 대로 Slurm 클러스터에 워커 노드를 비동기적으로 추가하므로, 각 새 노드가 온라인 상태가 될 때 심층 상태 점검을 실행하여 정상 노드에서 이미 실행 중인 워크로드를 중단하지 않고 작업을 예약하기 전에 하드웨어를 검증할 수 있습니다. 진행 상황과 결과는 SageMaker 콘솔 및 API를 통해 인스턴스 그룹 및 인스턴스 수준 모두에서 확인할 수 있으며, GPU 상태, 네트워크 연결 및 다중 노드 통신 성능에 대한 완전한 가시성을 제공합니다. 점검 중인 인스턴스는 작업 예약에서 자동으로 격리되며, 통과 시 서비스에 복귀됩니다. HyperPod의 자동 노드 복구 기능과 함께 사용하면, 실패한 인스턴스는 자동으로 재부팅되거나 교체되어 클러스터 상태를 보장합니다. 이 기능은 Amazon SageMaker HyperPod를 사용할 수 있는 모든 리전에서 사용할 수 있습니다. 온디맨드 심층 상태 점검 및 지속적 프로비저닝에 대해 자세히 알아보려면 Amazon SageMaker HyperPod 사용자 가이드를 참조하십시오.