中国优理奇机器人联合多所高校发布UniTac,实现触觉预判
2026-07-20 11:47
收藏

维度网讯,中国优理奇机器人(UniX AI)联合浙江大学、麻省理工学院、牛津大学、耶鲁大学及上海交通大学发布了全新科研成果UniTac,提出一套跨传感器触觉理解与生成架构,并将其接入视觉-语言-动作模型,使机器人具备在接触物体前预判触觉状态的能力。该工作已被ECCV 2026接收。

过去一年,具身基础模型快速发展,机器人能够完成轮廓清晰的物体操作任务。然而,当面对柔性物体、易损物体或密集接触场景时,机器人仅依靠视觉难以胜任。例如,捏起一颗葡萄而不捏破、抓住纸杯而不变形等任务,需要机器人具备类人的触觉感知能力。随着研究推进,UniTouch、AnyTouch等团队尝试统一不同触觉传感器的表征方式,FuSe、Tactile-VLA将触觉信息接入通用策略与VLA模型,TacImag则探索让机器人仅凭视觉和本体感觉“想象”触觉。但这些方法仍面临传感器数据异构、触觉理解与生成分散于不同模型等挑战。

UniTac通过大规模、多传感器数据学习统一触觉表征,使机器人能够基于视觉信息预测物体接触后的触觉状态,从而实现“未触先感”。以抓取纸杯为例,融合UniTac的VLA模型能够预判杯体受力后的形变,从而决定接触位置与力度;未融合UniTac的VLA则将纸杯直接捏扁。触觉信息由此从接触后的反馈,前移为接触前的先验。

机器人与物理世界交互需要完成三层接地:视觉-语言模型将抽象概念对应到现实物体,视觉-语言-动作模型将语义与动作轨迹关联,而第三层接地则需要机器人理解与预判接触过程中的物理后果。完全依赖视觉的VLA模型容易对外观相似物体采用同一策略,待接触发生后再修正时,易损物体已发生形变。UniTac将触觉状态预测前移至第一次接触之前,为VLA提供接触过程的先验信息,使首次接触更加安全。

UniTac处理的核心难题是触觉数据的跨传感器统一。视觉式触觉传感器(如GelSight、DIGIT、Duragel)通过相机记录凝胶受压形变,图像中混有物体属性与传感器配置两类信息。模型需区分哪些变化来自物体(硬度、粗糙度、纹理),哪些来自传感器(光照、凝胶状态、Marker布局)。为解决传感器异构问题,UniTac将触觉拆分为物理属性与传感器配置两部分。理解端同步学习物体属性描述与传感器识别,迫使模型区分信号来源;生成端将传感器token纳入生成过程,避免无条件触觉生成。最终实验表明,UniTac在理解与生成两端均取得领先:在PHYSICLEAR-Test上,UniTac-7B以66.51分领先Octopi等触觉理解模型及BLIP3o等统一模型;在属性-物体匹配任务中取得64.61分。面对Digit、GelSight、GelSight Mini与Duragel四类传感器,UniTac的平均SSIM达到0.836,平均PSNR达到19.93。

UniTac由优理奇机器人主导研发。该公司由耶鲁大学博士杨丰瑜于2024年4月在苏州创立,是一家全栈式具身智能企业。杨丰瑜担任UniTac论文共同一作。共同一作Jiahang Tu来自浙江大学,研究方向为计算机视觉与生成模型;通讯作者Hanbin Zhao为浙江大学助理教授,长期从事机器学习与生成模型研究;优理奇机器人Zhi Tao负责真机算法与系统落地。论文合作者还包括牛津大学Chenyang Ma、麻省理工学院Xihang Yu、耶鲁大学Ziyao Zeng与Alex Wong、上海交通大学Shaokai Wu等。此前的Touch and Go数据采集、UniTouch多传感器表征统一、TaRF视觉触觉三维对齐等工作均围绕触觉路线推进。UniTac将触觉理解、生成与跨传感器迁移纳入统一架构,并为VLA模型提供触觉先验,有望在家庭护理、精细装配、服务操作等场景中提升机器人操作的柔顺性与安全性。

本文来自全球互联网及战略合作伙伴信息的编译与转载,仅为读者提供交流,有侵权或其它问题请及时告知,本站将予以修改或删除,未经正式授权严禁转载本文。邮箱:news@wedoany.com