Amazon SageMaker HyperPod тепе... Заметка

Amazon SageMaker HyperPod теперь поддерживает разделение предварительного заполнения и декодирования

Amazon SageMaker HyperPod теперь предлагает разделение этапов предварительного заполнения и декодирования (DPD) для оптимизации инференса LLM. DPD разделяет этапы предварительного заполнения и декодирования инференса LLM на отдельные пулы GPU. Данные кэша ключ-значение передаются между этими пулами с использованием EFA и GPU-Direct RDMA. Это решает проблему, когда общие GPU вызывают задержки для запросов с длинным контекстом, влияя на другие. Выделяя GPU для вычислительно-интенсивного предварительного заполнения и для декодирования, ограниченного пропускной способностью памяти, устраняется конкуренция за ресурсы. DPD обеспечивает более стабильную задержку на токен и более высокую пропускную способность для строгих требований к задержке. Это также позволяет независимо масштабировать мощности предварительного заполнения и декодирования в зависимости от распределения рабочей нагрузки. Интеллектуальный маршрутизатор направляет запросы с длинным контекстом по разделенному пути, а короткие подсказки — напрямую к декодеру. DPD включается путем добавления pdSpec к существующему ресурсу InferenceEndpointConfig. Эта функция доступна в кластерах SageMaker HyperPod с использованием EKS на экземплярах с поддержкой EFA во всех поддерживаемых регионах AWS.