同一基准测试下的两个"Codex CLI"模型:测试框架隐藏... 笔记

同一基准测试下的两个"Codex CLI"模型:测试框架隐藏了模型

Specific Labs 的 Real-SWE 基准测试揭示了评估代码智能体时的一个关键问题:模型名称如"Claude Code"或"Codex CLI"具有误导性,因为它们代表的是运行框架(harness),而非底层的 AI 模型。同一运行框架在不同集成模型下可表现出截然不同的性能。例如,GPT-6 Astra 在 Codex CLI 上取得了 33.8% 的解决率,而 GPT-5.6 Sol 在同一框架下仅达到 16.2%。超过两倍的差异凸显了运行框架仅作为路由层,而非执行思考的组件。同样,Fable 5.1 在 Claude Code 上得分为 38.8%,而 GLM 5.3 在 Claude Code 上得分为 28.8%,相差十分。Real-SWE 正确地以“模型与运行框架组合”的形式呈现结果,这是一种诚实的做法,却常因可能在其自有工具下产生不利数据而被厂商回避。对于寻求代码智能体的团队而言,仅仅“使用 Claude Code"无法提供关于智能体实际能力的任何洞见。模型切换是最显著的性能杠杆,却在大多数营销宣传中保持隐匿。在审查基准测试分数时,至关重要的是同时识别所使用的模型和运行框架。关键细节包括约定、上下文传递、工具循环以及评判器。厂商不愿披露与分数关联的具体模型应被视为警示信号。运行框架(scaffold)对分数的影响可能远比智能体本身的推理能力更为深远。