AWS DevOps Agent를 사용하여 SageMaker HyperPod 인시던트 분류 및 근본 원인 분석 자동화
서론 대규모 머신러닝 워크로드: 학습, 미세 조정 및 추론은 수백에서 수천 개의 GPU 인스턴스로 구성된 클러스터에서 수일 또는 수주 동안 실행됩니다. 이 정도 규모의 플릿 전반에 걸쳐 운영 가시성을 유지하는 것은 지속적인 과제입니다. 하드웨어 상태 이벤트, 노드 수명 주기 전환, 용량 변동 및 워크로드 수준 문제는 이벤트 스트림에서 나타납니다. […]