给编码代理更多时间几乎帮不上忙
Real-SWE 让前沿模型在已授权的企业私有代码库(涵盖计费、税务及多服务工作)上进行了测试,其中一个数据点令我印象深刻:部署时长几乎不影响解决率。在 10 分钟内完成的部署中,71.4% 失败;运行时间达到或超过 10 分钟的部署中,73.4% 同样失败。无论哪种情况,通过率都稳定在 27% 至 29% 之间。将运行时间从几分钟延长至长时间部署,仅使结果偏移约两个百分点,这属于噪声。领跑者 Fable 5.1 配合 Claude Code 仅达到 38.8% 的解决率;GPT-6 Astra 配合 Codex CLI 为 33.8%。即便是顶级模型,在私有企业任务中仍有约六成失败。这正是厂商演示中刻意略过的部分。简单任务能被快速解决,因此在短部署中会呈现出较高的表观吞吐量。但真正关键的任务——那些深埋于实际薪资、税务及集成代码中的问题——却撞上了结构性壁垒。代理并非在这些任务上耗尽算力,而是耗尽了理解力、上下文,或是框架未提供正确的入口点。再多十分钟的循环重试也无法解决这些问题。Real-SWE 做得正确的另一件事是,将每个分数视为“模型 + 框架”的组合,而非仅针对模型本身。Fable 5.1 的 38.8% 是与其在 Claude Code 框架下的组合结果,这是针对私有代码的框架表现,而非对模型在真空环境中的陈述。许多排行榜仍仅发布模型名称而未固定框架,导致人们在不同脚手架之间进行对比,并得出荒谬的结论。给任何采购代理者的建议:当厂商向你展示通过率时,务必询问该数字源自哪个切片。一个因轻松解决快速、浅层任务而显得出色的模型,恰恰掩盖了你真正需要它解决的那类任务。基准来源:withspecific.com/benchmarks/real-swe