Android Bench 2.0: 挑戦的な長期間タスクでフロンティアを押し広げる
Android Bench はバージョン 2.0 にアップデートされ、複雑で数日間にわたるエンジニアリング課題を模倣したロングホライゾンタスク(LHTs)が導入されました。このアップグレードには、対応するモデルプロバイダーのエージェントから始まるエージェンティック評価も含まれています。以前のベンチマークは、より単純で段階的なコード変更に焦点を当てていましたが、新しい LHTs には、アプリの依存関係のアップグレード、機能の追加、ゼロからのアプリ構築などのタスクが含まれます。従来のバイナリスコアリングは、これらの複雑なタスクで達成されたニュアンスのある進捗をより良く反映するために、連続スコアリングに置き換えられています。この新しいスコアリング方法は、機能性、視覚的な忠実度を考慮し、リグレッションを回避し、指示の逸脱にはペナルティが課されます。現在、LHTs の最高合格率は約 28% であり、以前のベンチマークの成功率から大幅に低下しています。AI モデルは、既存のコードのリファクタリングよりも新しいコードの記述に強みを示し、確立された決定論的な変換に優れています。しかし、実行時検証、フレームワークの変更の破壊、または未リリースライブラリの知識ギャップを必要とするタスクには苦労しています。クロスプラットフォームアプリを Android に移植することは、AI にとって特に困難な領域であり続けています。評価には、エージェンティックワークフローでのパフォーマンスを評価するために、一般的に使用されるエージェントが組み込まれています。Gemini 3.8 Flash や OpenAI の GPT-6 などの新しいモデルがリーダーボードに追加されました。Android Bench 2.0 は、Android 開発のための AI を評価するためのより堅牢な環境を提供することにより、透明性を提供し、開発者に力を与えることを目指しています。今後の改善のために、更新された方法論とリーダーボードに関するフィードバックを歓迎します。