Давать программисту больше вре... Заметка
DEV Community на русском

Давать программисту больше времени почти не помогает

Real-SWE запускал передовые модели на лицензированных, частных корпоративных кодовых базах (биллинг, налоги, многосервисные работы), и одна цифра бросилась мне в глаза: продолжительность развертывания почти не влияет на результат.71,4% развертываний, завершившихся менее чем за 10 минут, ПРОВАЛИЛИСЬ. 73,4% развертываний, которые длились 10 минут или дольше, также ПРОВАЛИЛИСЬ. Уровень успешных попыток остается на уровне 27-29% в обоих случаях. Увеличение времени выполнения с минут до длительных развертываний изменяет результат примерно на два процентных пункта, что является шумом.Лидер, Fable 5.1 на Claude Code, достигает только 38,8% успешных решений. GPT-6 Astra на Codex CLI получает 33,8%. Лучшая модель по-прежнему терпит неудачу примерно в шести из десяти частных корпоративных задач.Это та часть, которую пропускают в демонстрациях поставщиков. Легкие задачи решаются быстро, поэтому при коротком развертывании вы видите высокую видимую пропускную способность. Но задачи, которые имеют значение, те, что скрыты в реальном коде расчета заработной платы, налогов и интеграции, упираются в структурную стену. Агент не исчерпывает вычислительные ресурсы на них. Он исчерпывает понимание или контекст, или система не предоставляет ему правильную точку входа. Еще десять минут повторных попыток ничего из этого не исправят.Другое, что Real-SWE делает правильно, — это рассматривает каждую оценку как модель+систему, а не только модель. Fable 5.1 имеет результат всего 38,8% в сочетании с каркасом Claude Code. Это результат системы на частном коде, а не утверждение о модели в вакууме. Так много рейтинговых таблиц по-прежнему публикуют названия моделей без указания системы, а затем люди сравнивают их с совершенно разными каркасами и делают бессмысленные выводы.Вывод для тех, кто покупает агента: когда поставщик показывает вам процент успешных попыток, спросите, из какой части взято это число. Модель, которая выглядит отлично, потому что она решает быстрые, поверхностные задачи, скрывает именно те, которые вам действительно нужно решить.Источник бенчмарка: withspecific.com/benchmarks/real-swe