Эволюция измерения LLM для And... Заметка

Эволюция измерения LLM для Android: следующая эра Android Bench

Android Bench, рейтинг больших языковых моделей для задач разработки под Android, был представлен в марте для повышения прозрачности и улучшения моделей. Основываясь на отзывах, бенчмарк теперь оценивает модели с открытым весом и включает в себя измерения стоимости и эффективности. В выпуске за июль используется фреймворк Harbor, обновленный агент для бенчмаркинга, для более тщательной оценки моделей. Это обновление потребовало повторного запуска всех моделей, что привело к незначительному изменению результатов, хотя исторические данные остаются доступными. В рейтинг были добавлены восемь новых моделей, включая Claude Fable 5, Claude Sonnet 5 и GLM 5.2. Claude Fable 5 в настоящее время лидирует с результатом 84,5, а GLM 5.2 возглавляет рейтинг моделей с открытым весом. Сообщество разработчиков Android теперь может внести свой вклад в Android Bench, предлагая новые задачи для разработки или запуская и делясь результатами бенчмаркинга. Эта инициатива направлена на создание бенчмарка, который действительно отражает разнообразные проблемы, с которыми сталкиваются разработчики Android по всему миру. Цель состоит в том, чтобы постоянно обновлять Android Bench, чтобы помощь искусственного интеллекта оставалась передовой, умной и более эффективной. Разработчикам рекомендуется взаимодействовать с репозиторием GitHub и Harbor Hub для внесения вклада, а также ознакомиться с обновленным рейтингом и методологией.