智能体模型能有多小?Nemotron 的极限 笔记

智能体模型能有多小?Nemotron 的极限

本分析对比了 NVIDIA Nemotron 模型在真实世界编码任务中的表现,以评估其有效性与价值。关键发现是:模型规模在代理任务中表现为一种阈值效应,而非质量的线性提升。最小的模型 Nemotron 12B 完全无法执行任务,因其能力低于临界门槛。在此门槛之上,选择应转向何种模型能满足特定工作需求。Nemotron 30B 是简单、定义明确任务的具有成本效益的选择;相反,Nemotron 120B 对于更复杂的多步骤代理操作则是必需的。评估采用真实任务与技能,既考察指令遵循能力,也评估任务完成度。与人为构造的基准测试不同,这些任务反映了实际的开发工作,揭示了根本性的能力差距。Nemotron 120B 模型大多能完成任务,但在精确遵循指令方面存在困难;而 Nemotron 30B 模型则在可靠完成任务方面存在问题,经常完全失败。这表明模型规模会显著改变结果,导致要么接近完美的表现,要么出现重大失败。技能虽能带来显著收益,但仅适用于已具备足够能力以利用这些技能的模型。将技能强加于低于能力门槛的模型上,并不能按比例提升性能。每任务成本可能具有误导性,因为失败与重试会引入隐性成本,使得看似更便宜的模型总体成本更高。因此,最优策略是首先明确工作所需的质量水平,然后选择符合该标准的模型。