VentureBeat на русском
Подписаться
Nvidia обнаружила, что простая линейная математика может заменить дорогостоящие передачи моделей ИИ.
Агентные ИИ-системы сталкиваются со значительным препятствием при переключении между большими языковыми моделями разного размера, поскольку принимающая модель должна пересчитывать всю историю разговора. Этот пересчет влечет за собой существенные вычислительные затраты и задержки, что препятствует работе с длинными и многомодельными рабочими процессами. Исследователи из Nvidia разработали метод передачи KV-кэша между моделями для решения этой проблемы. Этот метод напрямую отображает предварительно вычисленный KV-кэш из исходной модели в целевую модель. Этот процесс значительно снижает вычислительные затраты и задержки для корпоративных ИИ-приложений. Эксперименты показывают, что этот метод линейного отображения в 2,7–25 раз быстрее, чем пересчет кэша. Он также сохраняет до 98% автономной точности целевой модели для совместимых пар моделей. Техника использует линейную структуру KV-кэша, применяя простые алгебраические методы, а не дорогостоящее обучение глубоких нейронных сетей. Это обеспечивает плавное обновление от меньших моделей к большим для повышения качества вывода. Это также способствует снижению затрат за счет перехода от больших моделей к меньшим после первоначальной интенсивной обработки. Хотя изначально метод был сосредоточен на передаче моделей внутри одного семейства, он демонстрирует потенциал для более широкого применения. Это достижение предлагает важный инструмент для масштабирования многомодельных агентных систем при одновременном управлении затратами на вывод.