Curvine을 이용한 Amazon SageMaker HyperPod 상의 대규모 LLM을 위한 계층형 KV 캐시
대규모 언어 모델 추론을 실행하려면 KV 캐시 트레이드오프가 발생합니다. 오버사이즈 GPU 인스턴스를 사용하거나 느린 타임-투-퍼스트-토큰을 감수해야 합니다. 이 게시물은 Amazon SageMaker HyperPod에 계층화된 KV 캐시를 구축하여 Curvine을 통해 캐시를 공유 분산 NVMe 풀로 확장합니다. 이를 통해 복제본은 비용 효율적인 인스턴스에서 거의 로컬 디스크 속도로 캐시를 재사용할 수 있습니다.