AWS Machine Learning Blog на русском
Подписаться
Знакомство с шлюзом вывода Amazon SageMaker HyperPod
Amazon SageMaker HyperPod Inference Gateway — это облачное решение для Amazon EKS, совместимое с Kubernetes и учитывающее особенности GPU. Оно использует сигналы GPU в реальном времени для направления каждого запроса на вывод к наиболее подходящему поду, сокращая задержку первого токена до 82% без внесения изменений в серверы моделей или клиентские приложения.