美国谷歌发布人形机器人模型Gemini Robotics 2
2026-07-31 14:24
收藏

维度网讯,Alphabet Inc.旗下的人工智能研究实验室DeepMind(Google DeepMind)于今日推出Gemini Robotics 2系列模型。该系列面向人形机器人设计,可支持多台自主机器人协同完成一项任务,并能够自动执行包含数百个步骤的杂务。

目前主流人形机器人采用双系统AI架构:具身推理模型负责制定任务执行的高层计划,VLA模型则将计划转换为机器人电机的底层指令。Gemini Robotics 2系列的核心是名为Gemini Robotics ER 2的具身推理模型,用户可用自然语言描述机器人应执行的任务。据谷歌介绍,ER 2可支持包含数百个步骤、耗时数分钟的任务。

ER 2可将冗长的任务拆分给多台不同机器人以加速完成,同时其工具调用功能允许模型访问外部云服务,例如通过谷歌搜索来澄清提示中无法理解的部分。

针对人形机器人需要重试未成功任务的需求,工程师为ER 2配备了两项功能。其一,模型可利用机器人自身摄像头拍摄的画面跟踪任务进度,出错时会识别最后正确完成的步骤并从中断处继续,免去从头重做。其二,ER 2在判断任务完成时机方面优于前代模型,机器人越早确认一项任务结束,就能越快进入下一项任务,该功能也有助于简化识别纠错方法等环节。

谷歌工程师史蒂文·汉森(Steven Hansen)与Peng Xu在公司博客文章中介绍,机器人通过观看连续的视频流,可以跟踪自身进度、在出现问题时调整,并明确何时进入下一步。

ER 2制定行动计划后,可将指令发送给Gemini Robotics 2系列中另外两个VLA模型之一。第一个模型名为Gemini Robotics 2,可控制人形机器人全部身体部位,而不仅限于双手,能够在降低跌倒风险的前提下优化宿主机器的重心,同时支持比DeepMind早期软件更多种类的机械手。

第二个VLA模型名为Gemini Robotics On-Device 2,用于直接运行在人形机器人的板载计算机上,只需数小时训练即可适配到新机器人。开发人员可通过谷歌云、Gemini API和Google AI Studio访问ER 2。

伴随模型发布,谷歌还推出了新的具身AI安全基准ASIMOV-Agentic Benchmark,用于评估人形机器人避免碰撞等风险的能力。

本文来自全球互联网及战略合作伙伴信息的编译与转载,仅为读者提供交流,有侵权或其它问题请及时告知,本站将予以修改或删除,未经正式授权严禁转载本文。邮箱:news@wedoany.com