AWS Machine Learning Blog на русском
Подписаться
Развертывание Qwen3.8-2.4T-A95B на Amazon SageMaker HyperPod с vLLM
Узнайте, как развернуть Qwen3.8-2.4T-A95B, открытую модель с 2,4 триллионами параметров, на Amazon SageMaker HyperPod с помощью vLLM. Этот пошаговый план охватывает предоставление кластера, квантование NVFP4 и совместимую с OpenAI конечную точку со встроенным выводом, вызовом инструментов и нативным спекулятивным декодированием MTP.