Amazon SageMaker HyperPod가 이제 ... 노트

Amazon SageMaker HyperPod가 이제 더 빠른 추론 자동 확장 및 콜드 스타트 감소를 위해 모델 캐싱을 지원합니다.

Amazon SageMaker HyperPod가 이제 모델 캐싱을 지원합니다. 이는 모델 가중치와 컨테이너 이미지를 클러스터 노드에 미리 로드하여 파드가 몇 분이 아닌 몇 초 만에 시작되도록 하는 추론 최적화 기능입니다.챗봇, 에이전트 파이프라인, RAG, 문서 분석과 같은 워크로드를 위해 LLM 추론을 대규모로 실행할 때 콜드 스타트는 실제 병목 현상입니다. 배포 및 스케일 아웃 이벤트는 컨테이너 이미지와 모델 가중치를 다운로드하는 데 대부분의 시간을 소비합니다. 모델 크기가 커질수록 이 문제는 더욱 심각해지며, 대규모 모델은 트래픽을 처리하기 전에 수십 분이 걸립니다.모델 캐싱은 두 가지 독립적인 기능을 통해 이 문제를 해결합니다. 가중치 캐시는 모델 가중치를 로컬 NVMe에 저장하여 파드가 네트워크를 통해 S3 또는 FSx에서 가져오는 대신 빠른 로컬 스토리지에서 읽도록 합니다. 이미지 캐시는 컨테이너 이미지를 미리 가져와 파드가 ECR 다운로드를 완전히 건너뛰도록 합니다. 파드가 따뜻한 캐시가 없는 노드에 배치되면 자동으로 원본 소스에서 가져오는 것으로 대체되므로 파드가 멈추거나 실패할 위험이 없습니다.57GB에서 145GB에 이르는 모델에 대한 벤치마크 결과, 약 60% 더 빠른 스케일 아웃을 보여주며, 이미지 캐시는 2분 이상의 이미지 가져오기 시간을 단축합니다(97% 감소). 모델 크기가 커질수록 이점은 커지지만 원본 소스 경로의 안정성은 유지됩니다.고객은 InferenceEndpointConfig 또는 JumpStartModel 리소스에 modelCacheConfig 섹션을 추가하여 HyperPod Inference Operator를 통해 모델 캐싱을 활성화할 수 있습니다. 이 연산자는 수동 설정이나 정리 없이 전체 수명 주기를 처리합니다.모델 캐싱은 이제 SageMaker HyperPod를 사용할 수 있는 모든 리전에서 일반적으로 사용할 수 있습니다. 시작하려면 SageMaker HyperPod 설명서를 참조하십시오.