Amazon SageMaker HyperPod тепе... Заметка

Amazon SageMaker HyperPod теперь поддерживает кэширование моделей для более быстрого автомасштабирования инференса и уменьшения холодных стартов.

Amazon SageMaker HyperPod теперь поддерживает кэширование моделей — оптимизацию инференса, которая предварительно загружает веса моделей и образы контейнеров на узлы кластера, благодаря чему поды запускаются за секунды, а не за минуты.При масштабном инференсе LLM для таких рабочих нагрузок, как чат-боты, агентские конвейеры, RAG и анализ документов, холодный старт является серьезным узким местом. Развертывания и масштабирование тратят большую часть времени на загрузку образов контейнеров и весов моделей. С увеличением размера модели эта проблема усугубляется: большие модели требуют десятков минут, прежде чем смогут обслуживать трафик.Кэширование моделей решает эту проблему с помощью двух независимых функций. Кэш весов хранит веса моделей на локальном NVMe, поэтому поды считывают данные из быстрой локальной памяти вместо загрузки из S3 или FSx по сети. Кэш образов предварительно загружает образ контейнера, поэтому поды полностью пропускают загрузку из ECR. Если под попадает на узел без прогретого кэша, он автоматически возвращается к загрузке из исходного источника, поэтому нет риска, что поды застрянут или выйдут из строя.Тесты производительности на моделях размером от 57 ГБ до 145 ГБ показывают ускорение масштабирования примерно на 60%, а кэш образов сокращает время загрузки образов более чем на две минуты (сокращение на 97%). Преимущество увеличивается с размером модели, сохраняя при этом надежность исходного пути.Клиенты включают кэширование моделей через оператор HyperPod Inference Operator, добавляя раздел modelCacheConfig в свои ресурсы InferenceEndpointConfig или JumpStartModel. Оператор управляет полным жизненным циклом без ручной настройки или очистки.Кэширование моделей теперь общедоступно во всех регионах, где доступен SageMaker HyperPod. Чтобы начать работу, обратитесь к документации SageMaker HyperPod.