Уменьшение времени холодного с... Заметка

Уменьшение времени холодного старта при инференсе на Amazon SageMaker HyperPod с помощью кэширования моделей

Amazon SageMaker HyperPod теперь поддерживает кэширование моделей для инференса, которое предварительно загружает веса моделей и образы контейнеров на узлы кластера, чтобы поды читали данные с локального NVMe хранилища вместо загрузки по сети. Узнайте, как кэширование моделей сокращает время холодного старта с десятков минут до секунд, как оно работает и как его включить.