MachineLearningMastery.com на русском
Подписаться
Измерение производительности инференса трансформеров
Эта глава разделена на восемь частей; они следующие: • Метрики для инференса LLM • Измерение одного запроса • Разогрев и синхронизация • Измерение работы GPU с помощью событий CUDA • Измерение использования памяти • Измерение одновременных запросов • Несколько GPU и несколько машин • Стоимость за токен Наиболее распространенные метрики инференса: • Задержка: Сколько времени занимает запрос от начала до конца.