DEV Community 日本語
フォロー
エージェントモデルはどれほど小さくなれるか? Nemotronのフロア
この分析では、NVIDIAのNemotronモデルを実際のコーディングタスクで比較し、その有効性と価値を判断します。重要な発見は、モデルサイズがエージェントタスクにおける品質の線形的な改善ではなく、しきい値として機能することです。最小のモデルであるNemotron 12Bは、クリティカルな能力のしきい値を下回ったため、全く実行できませんでした。このしきい値を超えると、選択は特定の作業要件を満たすモデルに移ります。Nemotron 30Bは、シンプルで明確に定義されたジョブにとって費用対効果の高い選択肢です。逆に、Nemotron 120Bは、より複雑で多段階のエージェント操作に必要です。評価は、指示の遵守とタスク完了の両方を評価し、実際のタスクとスキルを使用します。人工的なベンチマークとは異なり、これらのタスクは実際の開発作業を反映しており、基本的な能力のギャップを浮き彫りにします。Nemotron 120Bモデルは、ほとんどのタスクを完了しますが、正確な指示の遵守に苦労します。しかし、Nemotron 30Bモデルは、信頼性の高い完了に問題を抱えており、しばしば完全に失敗します。これは、モデルのスケールが結果を劇的に変化させ、ほぼ完璧な結果または重大な失敗につながることを示唆しています。スキルは大きなメリットをもたらしますが、それはすでにそれに基づいて行動できる十分な能力を持つモデルでのみ有効です。能力のしきい値を下回るモデルにスキルを強制しても、パフォーマンスは比例して向上しません。タスクあたりのコストは誤解を招く可能性があります。失敗や再試行は隠れた費用を追加するため、一見安価なモデルの方が全体的にコストが高くなる可能性があります。したがって、最適なアプローチは、まず作業に必要な品質レベルを定義し、その基準を満たすモデルを選択することです。