VentureBeat на русском
Подписаться
Маршрутизатор Switchyard от Nvidia перераспределяет ИИ-модели в середине выполнения задачи, снижая затраты на задачу до трети в собственных тестах.
Предприятия сталкиваются со значительным компромиссом при использовании постоянно активных ИИ-агентов: использование передовых моделей дорого, в то время как пользовательская логика маршрутизации требует обширных инженерных усилий и обслуживания. Nvidia предлагает решение, выпустив Nemotron 3.5 Lightning, открытую модель "смесь экспертов" для специализированных задач, и NeMo Switchyard, библиотеку с открытым исходным кодом для интеллектуальной маршрутизации моделей. Lightning обеспечивает более быстрый вывод по сравнению с аналогичными моделями, а в сочетании с Switchyard обещает выполнение задач на уровне передовых моделей при частичной стоимости премиальных моделей. Этот выпуск выходит на конкурентный рынок с многочисленными моделями с открытым весом, появляющимися из Китая и от Meta. Стратегия Nvidia подчеркивает интегрированную систему как оптимизированной модели, так и умного маршрутизатора, а не отдельных компонентов. Switchyard конкурирует с существующими открытыми маршрутизаторами, предлагая динамические стратегии маршрутизации, которые адаптируются к изменяющемуся состоянию агента и соображениям стоимости. Библиотека интегрируется с популярными фреймворками агентов и шлюзами LLM, облегчая ее внедрение. Первые тестировщики сообщили о существенном снижении затрат и сохранении точности при использовании Switchyard. Сам Nemotron 3.5 Lightning предназначен для высокообъемных, специализированных задач агентов, расширяя гибридную архитектуру Nvidia Mamba-Transformer. Хотя Lightning не является лидером в области общего искусственного интеллекта, он демонстрирует высокую производительность в тестах скорости и точности. Для предприятий это означает переход к динамической маршрутизации на каждом шаге и стратегическое преимущество открытого исходного кода как на уровне моделей, так и на уровне маршрутизации. Конкурентный ландшафт эволюционирует от исключительно фокусировки на лучшей модели к оптимизации всей системы сопоставления моделей с задачами.