AI 辅助编程已经不只是“帮我补全一段代码”这么简单。越来越多开发者开始让大模型阅读项目、定位问题、修改代码、运行测试,甚至完成接近真实 Pull Request 的修复任务。

问题也随之出现:我们该如何判断一个模型是否真的适合 Android 开发?

Android Bench 就是 Google 面向这个问题推出的基准测试。它不是泛泛地测试模型会不会写代码,而是把重点放在真实 Android 工程任务上,评估大语言模型在 Android 项目中解决实际问题的能力。

bench