Curvine을 이용한 Amazon SageMaker ... 노트

Curvine을 이용한 Amazon SageMaker HyperPod 상의 대규모 LLM을 위한 계층형 KV 캐시

대규모 언어 모델 추론을 실행하려면 KV 캐시 트레이드오프가 발생합니다. 오버사이즈 GPU 인스턴스를 사용하거나 느린 타임-투-퍼스트-토큰을 감수해야 합니다. 이 게시물은 Amazon SageMaker HyperPod에 계층화된 KV 캐시를 구축하여 Curvine을 통해 캐시를 공유 분산 NVMe 풀로 확장합니다. 이를 통해 복제본은 비용 효율적인 인스턴스에서 거의 로컬 디스크 속도로 캐시를 재사용할 수 있습니다.
CdXz5zHNQW_kgyKTy3mMc.png