DEV Community на русском
Подписаться
Две модели "Codex CLI" на одном эталонном тесте: оболочка скрывает модель
Бенчмарк Real-SWE от Specific Labs выявляет критическую проблему в оценке кодирующих агентов. Названия моделей, такие как "Claude Code" или "Codex CLI", вводят в заблуждение, поскольку они представляют собой оболочку, а не базовую модель ИИ. Одна и та же оболочка может демонстрировать совершенно разную производительность в зависимости от интегрированной модели. Например, GPT-6 Astra на Codex CLI достигла 33,8% разрешения, в то время как GPT-5.6 Sol на той же оболочке показала только 16,2%. Эта более чем двукратная разница подчеркивает, что оболочка является лишь уровнем маршрутизации, а не компонентом, выполняющим мышление.Аналогично, Fable 5.1 на Claude Code набрала 38,8%, а GLM 5.3 на Claude Code — 28,8%, что составляет десятибалльное расхождение. Real-SWE корректно представляет результаты как комбинации модели и оболочки, что является честной практикой, которой часто избегают поставщики из-за потенциально неблагоприятных цифр при использовании их собственных инструментов. Для команд, ищущих кодирующих агентов, простое "использование Claude Code" не дает представления о реальных навыках агента. Замена модели является наиболее значимым фактором производительности, однако в большинстве маркетинговых материалов она остается скрытой.При рассмотрении результатов бенчмарков крайне важно идентифицировать как модель, так и используемую оболочку. Важные детали включают соглашения, передачу контекста, цикл инструментов и судью. Нежелание поставщика раскрывать конкретную модель, связанную с результатом, должно быть тревожным сигналом. Каркас, или оболочка, может влиять на результат гораздо сильнее, чем реальные возможности рассуждения агента.