Тот же DeepSeek V4 Flash, друг... Заметка
DEV Community на русском

Тот же DeepSeek V4 Flash, другой агент: почему среда выполнения меняет результат

Автор противопоставляет производительность DeepSeek V4 Flash двум различным средам выполнения кодовых агентов. Локальный тест показал, что Codex плюс Flash успешно справились со сложной задачей, охватывающей несколько файлов. Напротив, Claude Code плюс Flash инициировали несколько проверок, но их качество не было подтверждено. Это подчеркивает, что эффективность агента зависит от всей среды выполнения, а не только от модели. Среда выполнения включает в себя модель, протокол, инструменты, контекст, механизмы восстановления и критерии приемки. На результат влияют четыре ключевых уровня: протокол определяет траекторию взаимодействия, инструменты действуют как структурированные контракты, контекст и восстановление обеспечивают долговечность задачи во времени, а приемка определяет состояние завершения. Публичные обновления DeepSeek предполагают адаптацию к конкретным моделям и средам, а не универсальное доминирование. Автор предлагает рассматривать эффективность агента как произведение потенциала модели, умноженного на коэффициент реализации "сбруи". Достоверное сравнение требует фиксации всех переменных среды выполнения, кроме модели. В противном случае результаты следует рассматривать как наблюдения за средой выполнения, а не как рейтинги моделей. Модель определяет потенциал, но среда выполнения определяет, какая часть этого потенциала будет реализована. Автор призывает задуматься о самом слабом звене в текущем использовании агентов.