DEV Community на русском
Подписаться
Как малым может быть модель агента? Пол Немотрона
Этот анализ сравнивает модели Nemotron от NVIDIA на реальных задачах программирования, чтобы определить их эффективность и ценность. Одним из ключевых выводов является то, что размер модели действует как порог, а не как линейное улучшение качества для задач агента. Самая маленькая модель, Nemotron 12B, не смогла выполнить задачи вообще, поскольку она была ниже критического порога возможностей. Выше этого порога выбор смещается в сторону того, какая модель соответствует конкретным требованиям работы. Nemotron 30B является экономически эффективным вариантом для простых, хорошо определенных задач. Напротив, Nemotron 120B необходим для более сложных, многоступенчатых операций агента. Оценка использует реальные задачи и навыки, оценивая как выполнение инструкций, так и завершение задач. В отличие от искусственных тестов, эти задачи отражают фактическую разработку, подчеркивая фундаментальные пробелы в возможностях. Модель Nemotron 120B в основном завершает задачи, но испытывает трудности с точным выполнением инструкций. Модель Nemotron 30B, однако, имеет проблемы с надежным завершением, часто полностью терпя неудачу. Это говорит о том, что масштаб модели существенно меняет результаты, приводя либо к почти идеальным результатам, либо к значительным неудачам. Навыки обеспечивают значительные преимущества, но только на моделях, которые уже достаточно способны, чтобы действовать на них. Принуждение навыка на модель ниже порога возможностей не улучшает производительность пропорционально. Стоимость за задачу может быть вводящей в заблуждение, поскольку неудачи и повторные попытки добавляют скрытые расходы, делая казалось бы более дешевую модель более дорогой в целом. Следовательно, оптимальный подход заключается в том, чтобы сначала определить необходимый уровень качества работы, а затем выбрать модель, соответствующую этому стандарту.