AWS Machine Learning Blog на русском
Подписаться
Уменьшение задержки LLM с помощью маршрутизации с учетом префикса на Amazon SageMaker Inference
Amazon SageMaker Inference теперь предлагает маршрутизацию с учетом префиксов — стратегию маршрутизации, которая направляет запросы с одинаковым префиксом подсказки на один и тот же экземпляр, чтобы кэш KV оставался активным. В тестах на Llama 3.1 70B время до первого токена (P50) сократилось до 77%, а процент попаданий в кэш KV увеличился примерно с 25% до более чем 80%.