AndroidにおけるLLMの測定方法の進化:Android Benchの新時代
Android Bench は、Android 開発タスク向けの LLM リーダーボードであり、透明性とモデルの改善を促進するために 3 月に導入されました。フィードバックに基づき、このベンチマークは現在、オープンウェイトモデルを評価し、コストと効率の次元を含んでいます。7 月のリリースでは、より厳密なモデル評価のために、更新されたベンチマークエージェントである Harbor フレームワークを採用しています。この更新により、すべてのモデルを再実行する必要が生じ、スコアにわずかな変動がありましたが、履歴データは引き続きアクセス可能です。Claude Fable 5、Claude Sonnet 5、GLM 5.2 を含む 8 つの新しいモデルがリーダーボードに追加されました。Claude Fable 5 は現在 84.5 のスコアでリードしており、GLM 5.2 はオープンウェイトモデルのトップです。Android 開発者コミュニティは、新しい開発タスクを送信したり、ベンチマーク評価を実行して共有したりすることで、Android Bench に貢献できるようになりました。この取り組みは、世界中の Android 開発者が直面する多様な課題を真に反映するベンチマークを作成することを目的としています。目標は、AI アシスタンスが最先端で、よりスマートで、より効果的であり続けるように、Android Bench を継続的に更新することです。開発者は、貢献のために GitHub リポジトリと Harbor Hub に関与し、更新されたリーダーボードと方法論を確認することが奨励されています。