Уменьшение задержки LLM с помо... Заметка

Уменьшение задержки LLM с помощью маршрутизации с учетом префикса на Amazon SageMaker Inference

Amazon SageMaker Inference теперь предлагает маршрутизацию с учетом префиксов — стратегию маршрутизации, которая направляет запросы с одинаковым префиксом подсказки на один и тот же экземпляр, чтобы кэш KV оставался активным. В тестах на Llama 3.1 70B время до первого токена (P50) сократилось до 77%, а процент попаданий в кэш KV увеличился примерно с 25% до более чем 80%.
CdXz5zHNQW_Kz51MkzC1A.jpeg