에이전트 모델은 얼마나 작아질 수 있을까? 네모트론 플로어
이 분석은 NVIDIA의 Nemotron 모델들을 실제 코딩 작업에서 비교하여 효과성과 가치를 파악합니다. 주요 발견 사항은 모델 크기가 에이전트 작업의 품질에 대한 선형적인 개선보다는 임계값으로 작용한다는 것입니다. 가장 작은 모델인 Nemotron 12B는 중요한 능력 하한선 아래로 떨어져 전혀 성능을 발휘하지 못했습니다. 이 하한선 위에서는 특정 작업 요구 사항을 충족하는 모델을 선택하게 됩니다. Nemotron 30B는 간단하고 명확하게 정의된 작업에 대해 비용 효율적인 옵션입니다. 반대로, Nemotron 120B는 더 복잡하고 다단계 에이전트 작업을 위해 필요합니다. 평가는 실제 작업과 기술을 사용하여 지시 사항 준수 및 작업 완료를 모두 평가합니다. 인위적인 벤치마크와 달리, 이러한 작업은 실제 개발 작업을 반영하며 근본적인 능력 격차를 강조합니다. Nemotron 120B 모델은 대부분의 작업을 완료하지만 정확한 지시 사항 준수에 어려움을 겪습니다. 그러나 Nemotron 30B 모델은 안정적인 완료에 문제가 있으며 종종 완전히 실패합니다. 이는 모델 규모가 결과에 극적인 변화를 가져와 거의 완벽한 결과 또는 상당한 실패로 이어진다는 것을 시사합니다. 기술은 상당한 이점을 제공하지만, 이미 충분히 능력이 있어 기술을 활용할 수 있는 모델에서만 그렇습니다. 능력 하한선 아래의 모델에 기술을 강제로 적용해도 성능이 비례적으로 향상되지 않습니다. 실패와 재시도가 숨겨진 비용을 추가하기 때문에 작업당 비용은 오해의 소지가 있을 수 있으며, 겉보기에 더 저렴한 모델이 전체적으로 더 비싸게 됩니다. 따라서 최적의 접근 방식은 먼저 작업에 필요한 품질 수준을 정의한 다음 해당 표준을 충족하는 모델을 선택하는 것입니다.