Qwen 3.8-Max и Claude Opus 5 п... Заметка
VentureBeat на русском

Qwen 3.8-Max и Claude Opus 5 показывают, почему сырые баллы в бенчмарках не предсказывают счет

Новая модель Qwen 3.8-Max от Alibaba демонстрирует противоречивые результаты производительности: Alibaba утверждает, что она уступает только Claude Fable 5, в то время как независимый бенчмарк помещает ее в середину списка. Это расхождение объясняется различными лимитами токенов и времени, использованными при тестировании. В бенчмарках Alibaba использовались значительно более длительные тайм-ауты, что объясняет лучшие показатели.В статье утверждается, что цена за токен является недостаточной метрикой для оценки моделей, способных к рассуждению. Вместо этого предлагается метрика "стоимость за успешное выполнение задачи", которая учитывает все расходы, включая неудачные попытки, разделенные на успешно выполненные задачи. Такой подход дает более реалистичное представление об эффективности и стоимости модели.Кроме того, в статье подчеркивается, что частота отказов сильно зависит от настроек конфигурации, особенно от лимитов времени или токенов. Бенчмарки часто не различают полностью неправильные ответы и задачи, которые просто не успевают выполниться из-за истечения времени, причем исчерпание лимита является основной причиной неудач. Предлагается более четко сообщать о причинах неудач.Авторы выступают за то, чтобы лимиты времени или токенов были явными критериями приемки, а не скрытыми деталями. Это имеет решающее значение для создания эффективных систем агентов, поскольку оптимизация скорости без учета успешности может привести к увеличению затрат и плохим результатам. Несколько организаций уже внедряют метрики стоимости за успешное выполнение задачи.Для улучшения оценки моделей рекомендуется отдельно указывать причины неудач, рассчитывать стоимость за успешное выполнение задачи для каждого уровня усилий и устанавливать лимит по токенам, а не по реальному времени, если только задержка не является критичной. Наконец, рекомендуется проверять настройки усилий по умолчанию на развернутых моделях, поскольку более высокие настройки усилий не всегда дают лучшие результаты.
CdXz5zHNQW_gokBEm64di.png