Amazon SageMaker HyperPod가 이제 분산 프리필 및 디코드를 지원합니다.
Amazon SageMaker HyperPod가 이제 LLM 추론 최적화를 위해 Disaggregated Prefill and Decode(DPD)를 제공합니다. DPD는 LLM 추론의 사전 채우기(prefill) 및 디코딩(decode) 단계를 별도의 GPU 풀로 분리합니다. 키-값 캐시 데이터는 EFA와 GPU-Direct RDMA를 사용하여 이 풀 간에 전송됩니다. 이는 공유 GPU로 인해 긴 컨텍스트 요청이 다른 요청을 지연시키는 문제를 해결합니다. 컴퓨팅 바운드 사전 채우기와 메모리 대역폭 바운드 디코딩에 GPU를 할당함으로써 리소스 경합이 제거됩니다. DPD는 엄격한 지연 시간 요구 사항에 대해 보다 일관된 토큰당 지연 시간과 더 높은 처리량을 제공합니다. 또한 워크로드 분포에 따라 사전 채우기 및 디코딩 용량을 독립적으로 확장할 수 있습니다. 지능형 라우터는 긴 컨텍스트 요청을 분리된 경로를 통해, 짧은 프롬프트는 디코더로 직접 안내합니다. DPD는 기존 InferenceEndpointConfig 리소스에 pdSpec을 추가하여 활성화됩니다. 이 기능은 모든 지원 AWS 리전에서 EFA 지원 인스턴스에 EKS를 사용하는 SageMaker HyperPod 클러스터에서 사용할 수 있습니다.
InferenceEndpointConfig리소스에pdSpec을 추가하여 활성화됩니다. 이 기능은 모든 지원 AWS 리전에서 EFA 지원 인스턴스에 EKS를 사용하는 SageMaker HyperPod 클러스터에서 사용할 수 있습니다.