美国谷歌更新Android Bench评估大模型安卓开发
2026-07-14 10:20
收藏
维度网讯,谷歌对Android Bench基准测试进行了更新,该项目用于评估大型语言模型在Android开发任务中的表现。谷歌工程师重新设计了测试方法,添加了新模型,并允许开发者参与测试集的开发工作。

这次更新的主要内容是切换到Harbor框架,由该框架负责执行所有Android Bench测试。这一改变能够确保模型评估更加一致、结果可复现,并能更快添加新的测试场景。此外,新系统不仅评估回答质量,还会评估特定LLM的成本和效率。
第三方开发者现在可以影响基准测试的发展方向。谷歌鼓励开发者分享实际工作任务并讨论模型评估方法,这有助于定期更新测试集,并更准确地反映LLM在Android开发中的使用场景。
结果表中新增了多个语言模型,包括Claude Fable 5、Claude Sonnet 5、Claude Opus 4.8、GLM 5.2、Kimi K2.7 Code、MiniMax M3、Qwen 3.7 Max和Qwen 3.7 Plus。目前排名前三的是Claude Fable 5、GPT 5.5和Claude Sonnet 5。
本文来自全球互联网及战略合作伙伴信息的编译与转载,仅为读者提供交流,有侵权或其它问题请及时告知,本站将予以修改或删除,未经正式授权严禁转载本文。邮箱:news@wedoany.com
相关阅读

科威特CINET与谷歌云合作重塑信用基础设施
2026-09-08

澳大利亚Sharon AI与Rafay签五年编排协议
2026-09-08

Key ASIC与CT Vision拟在马来西亚建设300MW绿色AI数据中心
2026-09-08

Goodman获批在悉尼建设135MW Project Apollo数据中心
2026-09-08

墨西哥Cuasar Capital推进300MW AI数据中心园区
2026-09-07

LG Uplus联合四家企业组建PMDC联盟 开发100MW级模块化AI数据中心标准模型
2026-09-07

TCS旗下HyperVault拟投7000亿卢比建设1GW AI数据中心园区
2026-09-07

Diraq将在悉尼Equinix数据中心部署8量子比特量子计算机
2026-09-07

Pure DC伦敦70MW数据中心二期进入桩基施工
2026-09-06

Cerebras芬兰165MW AI数据中心首期50MW开工
2026-09-05











