AWS Machine Learning Blog на русском
Подписаться
Уменьшение времени холодного старта при инференсе на Amazon SageMaker HyperPod с помощью кэширования моделей
Amazon SageMaker HyperPod теперь поддерживает кэширование моделей для инференса, которое предварительно загружает веса моделей и образы контейнеров на узлы кластера, чтобы поды читали данные с локального NVMe хранилища вместо загрузки по сети. Узнайте, как кэширование моделей сокращает время холодного старта с десятков минут до секунд, как оно работает и как его включить.