论文题目:Visual-tactile pretraining and online multitask learning for humanlike manipulation dexterity
作者:Qi Ye, Qingtao Liu, Siyun Wang, Jiaying Chen, Yu Cui, Ke Jin, Huajin Chen, Xuan Cai, Gaofeng Li, Jiming Chen
发表期刊:Science Robotics, 2026年1月
一、研究背景
要让仿人多指机械手实现类人灵巧操作,离不开手指间精准协同控制。然而灵巧操作任务落地仍存在巨大挑战:操作与观测空间维度极高、手物接触动力学关系复杂、视觉遮挡频繁出现。
针对上述难题,《Science Robotics》期刊于今年上半年发表的《Visual-tactile pretraining and online multitask learning for humanlike manipulation dexterity》论文提出了解决方案。该文章借鉴人类 “观察模仿 + 实操练习” 的学习模式,提出一套两阶段学习框架:基于人类示范数据,通过自监督学习完成视觉 - 触觉融合表征学习;再结合强化学习与在线模仿学习,训练统一多任务操作策略。 这种解耦式学习方案仅依靠单目相机图像与简易二元触觉信号,就能让机器人习得具备泛化能力的操作技能。依托该统一策略,文章中的团队搭建了一套低成本感知多指机械手操作系统,可完成多项复杂操作任务。 在 5 类复杂任务、25 种物体的测试中,系统操作成功率达 85%;同时模型可泛化至 3 项未见过的全新任务 —— 这类新任务与训练数据具备相似的手物协同运动规律。
二、基本框架与研究难点
该论文提出了新的解耦式学习解决方案。结合交互学习带来的稀疏监督条件,同时借鉴神经科学结论,该论文提出解耦式学习方案,将多感官融合学习与动作控制策略学习拆分为两个独立阶段,如图2所示。第一阶段构建视觉 - 触觉编码器,基于大规模人类演示视频做自监督预训练,第二阶段通过机器人与环境交互完成强化学习。

Fig. 1 双阶段多模态学习
灵巧手难以做到真正的灵巧——控制难。机械手需要在高维动作空间中协调多根手指,同时处理与物体间动态、充满接触交互的复杂作用关系。现有的解决方案是基于动力学模型和使用无模型的强化学习两个方案,首先基于动力学模型的方案不能囊括所有的工况,这也是控制领域常见的问题,强化学习在机械臂和灵巧手上的应用就是为了解决这个问题,但是灵巧手的强化学习方案又存在本身动作空间维度极高、样本效率低下、训练不稳定等问题。为了解决上述问题,部分研究又使用了模仿学习、基于目标条件的目标函数 、奖赏先验等方式来引导探索,再有就是使用残差学习优化参考运动轨迹 。但这些方案又存在泛化难,不能训练出通用、多场景的操作策略。
工况信息难以被准确捕获——感知和模仿难。工况信息除了位置、姿态等还有纹理、感光条件等信息。即便是电脑的仿真环境能够提供完整的工况信息仿真,且目前的机械臂和灵巧手系统虽然搭载了一定的传感器,但是其没有办法完全获取这些信息。缺少一定维度的工况信息的话,对机械臂和灵巧手的训练将是致命的缺陷,导致其在后期训练失真。当前主流方案是通过遥操作采集完整轨迹的观测 - 动作配对数据,再结合模仿学习或强化学习训练,这个方案还是难以规避复杂的感知信息。近期研究开始尝试直接从人类视频演示中学习 ,通过预训练视觉编码器获取任务无关的通用先验表征,这类方法目前仅仅使用的是简易夹爪,多指机械手应用时会有视觉遮挡频发、接触动力学关系复杂等问题。现有研究大多采用「基于完整状态的教师模型 + 视觉 - 触觉学生模型」的训练框架 。
可以确定的是,视觉和触觉在工作中使用的权重占比较大。如何利用人类视觉 - 触觉同步演示数据(人类手部操作时,视觉观测与触觉感知天然一一对应),来学习多种复杂操纵技能。现有的视觉 - 触觉操纵算法,大多对视觉、触觉两种模态单独编码,再在策略学习阶段进行后期融合。该方案对简易机械夹爪尚且够用,但多指机械手动作空间维度极高,会导致奖励信号极度稀疏;多模态感知与动作策略联合学习时,效率低下、训练极易震荡。从人体的角度出发,神经科学研究表明,人类大脑皮层以及顶下小叶(IPL)神经元会专门整合手部的视觉、触觉感知信号并对整套多模态信息进行编码,如图1所示。

Fig. 2 仿人脑多任务统一策略决策流程
三、主要内容
文章中先制作感知信息编码,再训练控制策略。第一阶段是制作感知信息编码,该文章通过跨模态注意力机制对齐视觉、触觉各自独立的特征 Token,再引入专用融合 Token完成多模态信息整合;训练数据为穿戴触觉手套采集的海量人类操作演示视频。最终,网络能在超高维原始观测空间中,提取紧凑、低维、和任务强相关的特征流形,大幅提升后续策略学习的效率与泛化能力。第二阶段是训练一套统一控制策略,适配多种操纵任务。文章中使用了区别于传统的模仿学习和强化学的在线模仿学习策略,不再基于专家策略提前生成离线轨迹完成训练,而是在学习过程中迭代采集统一策略遍历过的状态,再查询对应任务的专家策略提供监督信号。 这种在线样本聚合机制对齐了学生策略与专家策略的观测分布,抑制误差累积,实现单套控制策略稳定完成多任务学习。
该文章在实际操作和实验部分中,在仿真环境设计 5 项任务、在真实世界设计 8 项任务。真实场景中,5 项任务(拧瓶盖、拧紧水龙头、拨操纵杆、桌面物体重定向、掌内物体翻转)作为训练任务同步放入仿真数据集,如图3所示;另外 3 项任务(削铅笔、拧螺丝、滑动零食包装袋)用于评估泛化能力,如图4所示。所有策略均先在仿真环境中使用 40 组物体完成训练;
实物测试分为两类物体,同分布物体(物体参数类似),分布外日常物品(物体参数不一致)。本实验以任务成功率(Success rate %) 作为核心评测指标。在仿真同源物体上的成功率。所有任务均需要精细手指协同控制,系统平均成功率达 87%。在分布外泛化能力测试中,尽管物体差异巨大,策略性能依旧稳定,平均成功率 85%。在 3 项训练(削铅笔9/10、拧螺丝6/10、滑动零食包装袋8/10)中从未见过的任务上测试策略性能,实验证明策略能够泛化至仅共享手部协调规律的全新任务,泛化效果取决于接触动力学与手物位移模式的相似度。

Fig. 3 训练阶段使用的任务

Fig. 4 用于泛化测试的未见过任务
为探究多模态融合在多任务操纵中的作用,我们设置两组消融基线:仅保留单模态输入(纯视觉 V / 仅触觉 T),其余训练流程、网络结构完全不变,基线1是仅输入 RGB 图像。基线2是仅输入二值化触觉事件作为外感受输入,多模态融合大幅提升模型对接触交互的感知能力,相比单模态方案,仿真到实物的性能衰减显著降低,如图5所示。以成功试次平均完成时长衡量系统效率,视触觉融合策略在所有场景下完成时间最短、波动最小,兼具鲁棒性与执行效率。单模态策略(纯视觉 / 纯触觉)执行速度更慢、稳定性差;其中仅触觉策略在水龙头任务完全失败,直接触发 40 秒时限上限,凸显单模态感知的固有缺陷。全新任务中,视触觉融合策略依旧保持高成功率与短时耗,证明预训练学习到的视触觉表征具备优秀泛化能力。

Fig. 5 不同输入模态的真实场景性能对比
更换多种触觉传感硬件,结果显示:本方法跨触觉硬件迁移性能优异,核心原因是模型将原始触觉信号统一抽象为「接触 / 无接触」二元表征。
为系统评估光照鲁棒性,分别对比视触觉融合(VT)、仅视觉(V) 两套策略在全新物体上的表现,光照剧烈变化时,视触觉融合策略性能始终稳定;仅依靠视觉的策略性能大幅衰减,这证明视觉感知失效时,触觉信号是保障任务鲁棒性的核心,如图6所示。

Fig. 6 多硬件适配与光照鲁棒性测试
该文章还验证了在线多任务模仿学习方案的有效性,选取机器人领域三类主流基线做对比,从零开始强化学习(Pure RL)、离线专家演示模仿学习(IL)、模仿学习后微调强化学习(IL+RL),全部基线在完全相同条件下训练(输入模态、任务标识、网络架构一致),如图7所示。纯强化学习 Pure RL,需要数百万环境交互步数才能缓慢提升性能;桌面物体重定向、掌内翻转任务可完成,但拧瓶盖任务完全失败。证明多任务灵巧操作仅靠试错 RL 学习难度极高。离线模仿学习 IL,监督学习损失可收敛至接近 0,但任务成功率比本文在线模仿学习低约 20%。根源是离线采集演示数据会累积时序决策误差,引言中已讨论该缺陷。IL+RL(模仿后强化微调),先模仿学习初始化,再用 RL 优化,性能有明显提升,但仍存在多任务学习固有缺陷;同时 RL 阶段奖励基于不同维度设计,即便物理反馈一致,也会产生与专家策略偏差较大的行为。传统模仿学习离线存储专家轨迹,而本方法在训练过程中迭代采集当前策略遍历的状态,实时查询对应专家策略提供监督信号。 统一策略运行时会产生专家从未见过的观测,带来观测分布偏移;但全部任务中,即便物体、动力学差异巨大,机械手轨迹、手部运动模式具备相似性,统一策略能从海量同类操纵经验中获益。在线模仿学习(Online IL)在训练 / 全新仿真物体上成功率全面优于其余基线;多数任务下融合视触觉的统一策略性能超越专家基线。该文章还将方案与当前主流完整状态蒸馏框架(state expert → VT unified)做对比实验,传统方案蒸馏后的学生策略在全新物体上成功率仅 58.8%,相比专家性能衰减 12%,而本文方案在全新物体上相比专家提升 6%。 传统状态蒸馏流水线存在信息丢失问题,学生网络需要同时学习图像映射、动作控制,观测信息丢失会直接降低性能; 而本文方案中,专家、学生共享同一套环境表征,蒸馏过程不会产生信息损耗,甚至能通过共享交互经验提升学生策略性能。

Fig. 7 传感模态与学习策略的定量消融实验
该文章还做了类人操纵行为定量分析,为探究学习策略的操纵行为特征,文章统计了不同预训练模型的触觉接触时序,并与人类演示数据对比。 分析指标有每项任务三类主流触觉通道的接触片段平均时长,反映手物交互时序结构;全部任务各触觉传感器的激活频率。结果证明融合双模态输入后,机器人行为时序结构更贴近人类手物交互,接触模式与人类演示高度匹配。
为解释视触觉预训练带来更强类人行为、光照鲁棒性、仿真 - 实物迁移能力的底层原因,文章做了可视化预训练网络 IPL 融合 Token 的注意力热力图,如图8所示。视触觉融合模型的注意力持续聚焦机械手、被操作物体,尤其集中在接触区域、动态交互位置;纯视觉模型无此聚焦特性。预训练网络从人类演示图像中学习到更贴合任务的特征。尽管仿真人类演示、实物机械手外观不同,但注意力始终锁定手物交互区域,大幅削弱画面无关区域干扰;视觉、触觉信息融合可弥补仿真、实物间视觉差异。可视化显示,模型注意力会随手部、物体交互动力学动态变化。这套注意力动态变化机制解释了预训练模型对全新操纵任务的泛化能力,视触觉预训练网络学会捕捉物体与手部交互动力学,融合视觉、触觉感官信息。


Fig. 8 类人触觉模式与 IPL 融合单元注意力可视化
该文提出的整套方法训练出一套统一策略,仅依靠单目 RGB 图像、二元触觉事件,就能完成大量需要精细手指协同运动的灵巧操纵任务,有极高的成功率(85%左右)、执行效率。除此之外,模型具备优秀泛化性能。在线模仿学习优于传统离线模仿、纯强化学习,解决了多指机械手误差累积问题,多任务训练效率、泛化能力全面领先基线。实验结果证明:融合人类演示、触觉事件预训练得到的策略,生成的接触行为相比仅用视觉训练的模型,更贴近人类操作习惯。
四、创新点
多模态可减少系统对工况感知信息的遗漏。多模态融合大幅提升系统对接触交互的感知能力,融合双模态输入后,机器人行为时序结构更贴近人类手物交互,接触模式与人类演示高度匹配。系统具备更好的鲁棒性、执行效率和泛化能力。但是多模态高纬度信息的处理和信息融合的策略也是一个需要考虑的边界问题。
在线学习框架可以兼顾工作和更新。论文里「前台干活+后台更新」的并行模式,可以让机械臂边干活边更新自身,而不需要停机训练、开机测试等繁琐、低效的步骤。
预训练可提高训练效率。给定系统一定的预训练,相当于在人类工作中,徒弟在上机实操之前,师傅给详细讲解工作流程和注意事项,让系统不会从完全空白开始。
技术方案需要考虑泛化能力。在论文中,在线模仿学习有较为优秀的泛化能力,文中使用了5项作业进行训练,但是用了3项未训练的工作测试系统的泛化能力,结果机械臂完成的成功率较高,这是具身智能所需要的“智能化”的部分,不需要针对一个特定的工作就训练一个特定的模型。
结语
该文章指出了行业内灵巧手作业任务的难点问题:操作与观测空间维度极高、手物接触动力学关系复杂、视觉遮挡频繁出现。
该文章借鉴人类 “观察模仿 + 实操练习” 的学习模式,提出一套两阶段学习框架:第一阶段仿人脑学习人类作业操作;第二阶段结合强化学习与在线模仿学习,训练统一多任务操作策略。
这种解耦式学习方案仅依靠低成本设备就取得了好的作业效果。在 5 类复杂任务、25 种物体的测试中,系统操作成功率达 85%;同时模型可泛化至 3 项未见过的全新任务 —— 这类新任务与训练数据具备相似的手物协同运动规律。该系统同时也有较好的多模态信息融合效果、类人互动、作业效率、训练效率、迁移性、鲁棒性、泛化能力。
在未来的现实生活和工业生产中,机器人需要胜任更为复杂的工作。相比于文章中的测试工作,许多任务是更为复杂的,比如管理运转的机器、根据多分支逻辑来处理复杂情况、在正常工作中处理复杂突发情况等,而不是单纯的简单、单一的工作,这需要系统具备对动态工作的感知、分析、决策、跟踪、处理等,涉及到传感器、智能体、算法、执行机构、以及数据和代码逻辑的协调配合。基于论文,可以先增加工作的动态工作内容、复杂度等级,逐渐增加任务的复杂程度,根据任务和技术瓶颈也可以改进技术方案,最终逐步实现机器人智能化。