美国谷歌更新Android Bench评估大模型安卓开发
2026-07-14 10:20
收藏
维度网讯,谷歌对Android Bench基准测试进行了更新,该项目用于评估大型语言模型在Android开发任务中的表现。谷歌工程师重新设计了测试方法,添加了新模型,并允许开发者参与测试集的开发工作。

这次更新的主要内容是切换到Harbor框架,由该框架负责执行所有Android Bench测试。这一改变能够确保模型评估更加一致、结果可复现,并能更快添加新的测试场景。此外,新系统不仅评估回答质量,还会评估特定LLM的成本和效率。
第三方开发者现在可以影响基准测试的发展方向。谷歌鼓励开发者分享实际工作任务并讨论模型评估方法,这有助于定期更新测试集,并更准确地反映LLM在Android开发中的使用场景。
结果表中新增了多个语言模型,包括Claude Fable 5、Claude Sonnet 5、Claude Opus 4.8、GLM 5.2、Kimi K2.7 Code、MiniMax M3、Qwen 3.7 Max和Qwen 3.7 Plus。目前排名前三的是Claude Fable 5、GPT 5.5和Claude Sonnet 5。
本文来自全球互联网及战略合作伙伴信息的编译与转载,仅为读者提供交流,有侵权或其它问题请及时告知,本站将予以修改或删除,未经正式授权严禁转载本文。邮箱:news@wedoany.com
相关阅读

欧洲瑞安航空与谷歌云启动五年合作 支持2034年3亿乘客目标
2026-08-14

日本TIER IV加入边缘AI半导体计划,开源自动驾驶芯片
2026-08-14

LG与英伟达签署AI合作备忘录,天安AI工厂拟扩至80兆瓦
2026-08-14

OpenAI测试Ultrafast推理模式,GPT-5.6 Sol输出速度最高达每秒750个Token
2026-08-14

美国谷歌发布Gemini 3.7 Flash,API降50%
2026-08-14

Together AI签署2.4亿美元IBM云算力协议
2026-08-13

SpaceXAI发布Grok 4.6旗舰模型
2026-08-13

日本KDDI拟三年投资1万亿日元加码AI与云基础设施
2026-08-13

马来西亚U Mobile与OpenAI合作推进5G与企业AI
2026-08-13

中国长安汽车与华为签署战略合作框架协议
2026-08-12











