演进 LLM 在 Android 上的评估方式:Androi... 笔记

演进 LLM 在 Android 上的评估方式:Android Bench 的新时代

Android Bench 是一款面向 Android 开发任务的 LLM 排行榜,于三月推出,旨在促进透明度并推动模型改进。根据反馈,该基准现已纳入开源权重模型,并增加了成本与效率维度。七月版本采用 Harbor 框架(一种更新的基准测试代理),以实现更严格的模型评估。此次更新要求重新运行所有模型,导致分数出现小幅波动,但历史数据仍可访问。排行榜新增了八款模型,包括 Claude Fable 5、Claude Sonnet 5 和 GLM 5.2。目前,Claude Fable 5 以 84.5 分位居榜首,而 GLM 5.2 在开源权重模型中领先。Android 开发者社区可通过提交新的开发任务或运行并分享基准评估结果来参与 Android Bench 的建设。该举措旨在构建一个真正反映全球 Android 开发者所面临多样化挑战的基准。目标是持续更新 Android Bench,确保 AI 辅助工具始终保持前沿、更智能且更有效。开发者被鼓励访问 GitHub 仓库和 Harbor Hub 进行贡献,并查阅更新后的排行榜与方法论。