Android Bench 2.0: Расширяя гр... Заметка

Android Bench 2.0: Расширяя границы с помощью сложных задач с длительным горизонтом

Android Bench обновлен до версии 2.0, которая включает долгосрочные задачи (LHT), отражающие сложные многодневные инженерные вызовы. Это обновление также включает оценку агентов, начиная с агентов от соответствующих поставщиков моделей. Предыдущий бенчмарк фокусировался на более простых, инкрементальных изменениях кода, но новые LHT включают такие задачи, как обновление зависимостей приложений, добавление функций и создание приложений с нуля. Традиционная бинарная оценка заменяется непрерывной оценкой, чтобы лучше отразить тонкий прогресс, достигнутый в этих сложных задачах. Новый метод оценки учитывает функциональность, визуальную точность и отсутствие регрессий, с штрафами за отклонения от инструкций. В настоящее время самый высокий процент успешного выполнения LHT составляет около 28%, что значительно ниже уровня успеха предыдущего бенчмарка. Модели ИИ демонстрируют силу в написании нового кода по сравнению с рефакторингом существующего кода, преуспевая в установленных детерминированных преобразованиях. Однако они испытывают трудности с задачами, требующими проверки во время выполнения, изменениями фреймворка или пробелами в знаниях в невыпущенных библиотеках. Портирование кроссплатформенных приложений на Android остается особенно сложной областью для ИИ. Оценка теперь включает часто используемых агентов для оценки производительности в агентских рабочих процессах. Новые модели, такие как Gemini 3.8 Flash и GPT-6 от OpenAI, были добавлены в таблицу лидеров. Android Bench 2.0 призван обеспечить прозрачность и расширить возможности разработчиков, предлагая более надежную среду для оценки ИИ для разработки под Android. Приветствуются отзывы о обновленной методологии и таблице лидеров для будущих улучшений.