Unsloth를 사용하여 Amazon SageMaker AI에 양자화된 모델 배포하기
이 게시물에서는 Unsloth로 이미 양자화된 모델을 AWS 인프라에 배포하기 위한 네 가지 배포 패턴을 배우게 됩니다. 이 패턴들은 직접 인스턴스 액세스를 위한 Amazon Elastic Compute Cloud(Amazon EC2), 관리형 서빙을 위한 Amazon SageMaker AI 추론 엔드포인트, 그리고 추론이 기존 컨테이너 프레임워크에 맞춰져야 할 때 Amazon Elastic Kubernetes Service(Amazon EKS) 또는 Amazon Elastic Container Service(Amazon ECS)를 사용합니다. 또한 프로덕션 배포를 위한 운영 사례도 배우게 됩니다.