AWS Machine Learning Blog на русском
Подписаться
Развертывание квантованных моделей на Amazon SageMaker AI с помощью Unsloth
В этой статье вы узнаете о четырех моделях развертывания для размещения моделей, уже квантованных с помощью Unsloth, в инфраструктуре AWS. Модели используют Amazon Elastic Compute Cloud (Amazon EC2) для прямого доступа к экземплярам, конечные точки вывода Amazon SageMaker AI для управляемого обслуживания и Amazon Elastic Kubernetes Service (Amazon EKS) или Amazon Elastic Container Service (Amazon ECS), когда вывод должен соответствовать существующей инфраструктуре контейнеров. Вы также узнаете об операционных практиках для производственных развертываний.