Android Bench 2.0: 도전적인 장기 과제로... 노트

Android Bench 2.0: 도전적인 장기 과제로 한계를 넓히다

Android Bench가 버전 2.0으로 업데이트되어 복잡하고 다일한 엔지니어링 과제를 반영하는 장기 과제(LHTs)를 도입했습니다. 이번 업그레이드에는 해당 모델 제공업체의 에이전트부터 시작하는 에이전트 평가도 포함됩니다. 이전 벤치마크는 더 간단하고 점진적인 코드 변경에 초점을 맞췄지만, 새로운 LHT는 앱 종속성 업그레이드, 기능 추가, 처음부터 앱 빌드와 같은 과제를 포함합니다. 전통적인 이진 채점은 이러한 복잡한 과제에서 이루어진 미묘한 진행 상황을 더 잘 반영하기 위해 연속 채점으로 대체되고 있습니다. 이 새로운 채점 방식은 기능성, 시각적 충실도를 고려하고 회귀를 피하며 지침 위반에 대한 페널티를 부과합니다. 현재 LHT의 최고 통과율은 약 28%로, 이전 벤치마크의 성공률에서 크게 하락했습니다. AI 모델은 기존 코드를 리팩토링하는 것보다 새 코드를 작성하는 데 강점을 보이며, 확립된 결정론적 변환에 탁월합니다. 그러나 런타임 검증, 프레임워크 변경 중단 또는 출시되지 않은 라이브러리의 지식 격차가 필요한 작업에는 어려움을 겪습니다. 크로스 플랫폼 앱을 Android로 포팅하는 것은 AI에게 특히 어려운 영역으로 남아 있습니다. 평가는 이제 에이전트 워크플로우에서의 성능을 평가하기 위해 일반적으로 사용되는 에이전트를 통합합니다. Gemini 3.8 Flash 및 OpenAI의 GPT-6와 같은 새로운 모델이 리더보드에 추가되었습니다. Android Bench 2.0은 Android 개발을 위한 AI 평가를 위한 보다 강력한 환경을 제공함으로써 투명성을 제공하고 개발자에게 권한을 부여하는 것을 목표로 합니다. 향후 개선을 위해 업데이트된 방법론 및 리더보드에 대한 피드백을 권장합니다.