Android Bench 2.0:通过具有挑战性的长周期任务推动前沿发展
Android Bench 已更新至 2.0 版本,引入了长周期任务(LHTs),以模拟复杂的多天工程挑战。此次升级还包含代理评估(agentic evaluation),首批涵盖来自相应模型提供商的代理。此前的基准测试侧重于更简单、渐进式的代码变更,而新的 LHTs 则包括应用依赖升级、功能添加以及从零构建应用等任务。传统的二元评分方式正被连续评分所取代,以更准确地反映在这些复杂任务中取得的细微进展。该新评分方法综合考虑功能实现、视觉保真度及回归规避情况,并对指令偏离施加惩罚。目前,LHTs 的最高通过率约为 28%,较此前基准的成功率显著下降。AI 模型在编写新代码方面表现优于重构现有代码,在既定的确定性转换任务中尤为出色。然而,它们在需要运行时验证、涉及框架变更或存在未发布库知识缺失的任务中表现困难。将跨平台应用移植到 Android 仍是 AI 面临的极具挑战性的领域。评估现已纳入常用代理,以衡量其在代理工作流中的性能。排行榜中新增了 Gemini 3.8 Flash 和 OpenAI 的 GPT-6 等模型。Android Bench 2.0 旨在通过提供更稳健的评估环境,提升透明度并赋能开发者,从而更好地评估用于 Android 开发的 AI。欢迎对更新后的方法论及排行榜提供反馈,以推动未来改进。