Android LLM 측정 방식의 진화: Android... 노트

Android LLM 측정 방식의 진화: Android Bench의 다음 시대

Android 개발 작업을 위한 LLM 리더보드인 Android Bench는 투명성과 모델 개선을 촉진하기 위해 3월에 도입되었습니다. 피드백을 바탕으로 벤치마크는 이제 오픈 웨이트 모델을 평가하고 비용 및 효율성 차원을 포함합니다. 7월 릴리스는 보다 엄격한 모델 평가를 위해 업데이트된 벤치마킹 에이전트인 Harbor 프레임워크를 채택합니다. 이 업데이트로 인해 모든 모델을 다시 실행해야 했으며 점수에 약간의 변화가 있었지만, 과거 데이터는 계속 액세스할 수 있습니다. Claude Fable 5, Claude Sonnet 5, GLM 5.2를 포함한 8개의 새로운 모델이 리더보드에 추가되었습니다. Claude Fable 5는 현재 84.5점으로 선두를 달리고 있으며, GLM 5.2는 오픈 웨이트 모델 중 최고입니다. Android 개발자 커뮤니티는 이제 새로운 개발 작업을 제출하거나 벤치마크 평가를 실행하고 공유함으로써 Android Bench에 기여할 수 있습니다. 이 이니셔티브는 전 세계 Android 개발자가 직면한 다양한 과제를 진정으로 반영하는 벤치마크를 만드는 것을 목표로 합니다. 목표는 AI 지원이 최첨단이고 더 스마트하며 더 효과적으로 유지되도록 Android Bench를 지속적으로 업데이트하는 것입니다. 개발자는 기여를 위해 GitHub 리포지토리 및 Harbor Hub에 참여하고 업데이트된 리더보드 및 방법론을 검토하도록 권장됩니다.