Science Robotics研究:检索增强操作(RAM)赋予机器人用于操作的空间常识

作者:辛贵鹏时间:2026-06-12点击数:

有些机器人失败,看上去像是没有听懂人话,细看往往是没有看懂空间。人说把碗放到盘子上,机器人需要知道碗的底面在哪里,盘子的上表面在哪里,两个面的中心和法向该怎样对齐,路径中会不会撞到其他东西。语言只给了任务意图,真正决定任务成败的,是三维世界里的位置、朝向、接触和约束。

Science Robotics 近日发表的这项研究提出 Retrieval-Augmented Manipulation,简称 RAM。它的做法很直接:为模型接入一个可检索的物体中心知识库,避免把所有三维物理知识都压进视觉语言模型的参数里。机器人先从知识库中取出某类物体的形状模板、稳定抓取、功能平面和空间先验,再把这些知识对齐到眼前的具体物体,最后让 VLM 基于这些空间信息生成可执行的子目标。

这篇论文最核心的点在于,它把一个很朴素的问题讲清楚了:大模型可以负责理解人的意图,但机器人要在物理世界里可靠行动,还需要一套能被检查、能被迁移、能被运动规划使用的空间表达。对于我们正在关注的工具智能,这一点尤其重要。工具的意义不止在名称和类别,更在于它如何被握持,如何接触目标,如何把机器人本体的动作传递成对目标的作用。

图1 RAM 框架总览图

一、背景:会规划任务,还不等于会执行动作

过去几年,VLM 在语义理解和任务拆解上进步很快。给它一张桌面图片,再输入整理餐桌这类指令,模型通常能说出先移动杯子、再摆放餐盘、最后清理杂物这样的步骤。问题在于,机器人操作并不只是生成步骤。它必须在执行时处理物体姿态、功能部位、抓取方向、运动路径和碰撞风险。

论文开篇指出,当前 VLM 与机器人操作之间存在一个很深的语义到几何落差。模型能理解把碗放到盘子上这句话,却未必知道该让哪一个平面与哪一个平面对齐,也未必知道抓哪里才稳定,移动时怎样避开障碍。计划在文字上合理,到了机械臂末端就可能变成一个模糊目标。

直接用大规模三维数据微调模型也很难彻底解决这个问题。三维物体的形状、功能部位、姿态和交互方式组合太多,高质量的三维交互数据又很贵。RAM 的思路更接近工程上的折中:让大模型保持它擅长的语义推理能力,同时把空间知识放在外部知识库中,在需要时取出来,并通过视觉落地对齐到当前场景。

这个思路和近年来检索增强生成的逻辑有相似之处,不过机器人场景里的检索对象变了。这里要取出的内容,从文档段落换成了物体的三维模板、功能区域、抓取方式和可执行约束。换句话说,机器人要查的知识,已经从物体语义名称进一步走向了物体在物理空间里的使用方式。

二、方法:给 VLM 接上一套物体中心知识引擎

RAM 的整体流程并不复杂,可以分成三个连续环节。第一步,系统根据用户指令识别任务涉及的物体类别,并从物体中心知识库中取出相应模板。每类物体都有一个标准形状模板,其中记录了规范姿态、尺寸、稳定抓取构型和功能平面。对碗来说,开口区域、底部支撑面和可抓取位置都是任务相关信息;对刷子来说,刷毛方向和握持区域才是执行清扫动作的关键。

第二步,系统把模板知识落到眼前的具体物体上。论文使用 RGB-D 图像和二维分割模型找到任务相关物体,再基于 DINO-v2 特征和三维特征提升模块建立物体实例与类别模板之间的对应关系。这样一来,即使眼前的碗、杯子或勺子与模板不完全一样,系统仍然可以估计姿态、大小、抓取位置和功能平面。

第三步,VLM 用增强后的空间上下文进行任务分解。它接收到的内容不再只有一张图和一句话,还包括物体大小、姿态、功能面、抓取点和空间关系。于是模型可以把高层指令拆成更具体的子目标,比如让某个物体的底面与另一个物体的上表面对齐,或让刷子的工作方向与桌边保持合适角度。随后,系统把这些关系转换为点到点、点到面和面到面的约束,并交给轨迹优化器生成机器人动作。

这套方法的关键在于,空间知识进入了规划和执行过程,没有停留在描述层面。VLM 负责选用哪些空间关系,视觉落地模块负责把关系绑定到当前物体,轨迹优化器负责让机械臂真正走过去。语义、几何和控制在同一条链路上接起来,机器人执行时就少了许多凭感觉猜的成分。

图2 RAM 方法流程图

三、任务设置

论文在真实机器人平台上设计了 14 个空间感知操作场景,涉及 31 个物体实例和 11 类物体。任务覆盖三类能力:空间语言指令跟随、单张目标图像引导的物体重排,以及需要工具和物理约束推理的桌面清扫。

第一类任务考验机器人能不能听懂细粒度空间指令。例如,把勺子旋转 90 度,让相机正对玩偶,把多把勺子排到蓝色勺子的右侧并保持同样朝向。这里难点不在识别勺子或相机,而在于位置关系和朝向关系必须被准确执行。

第二类任务更加接近人类日常操作。系统只给机器人一张目标图像,让它把餐具摆成图中样子。目标图像可以来自任意视角,机器人需要从二维图像中推断三维布局,再把长时序重排拆成一系列可执行动作。

第三类桌面清扫最能体现工具智能的味道。场景中有刷子、簸箕、不同尺寸的垃圾桶和高度可调的桌子。仅凭语义,模型可能会直接决定用刷子把物体扫进垃圾桶。但当垃圾桶高度超过桌面,或者开口位置不合适时,这个计划在物理上就不成立。RAM 会把桌高、垃圾桶尺寸、簸箕边缘和刷子方向纳入推理,然后决定采用直接清扫,还是先扫入簸箕再倒入垃圾桶。

图3 空间指令任务全景

四、结果

在空间语言指令任务中,论文测试了 12 个任务,每个任务重复 10 次,总计 120 次试验。RAM 的平均成功率达到 89.17%,在最难的多物体多步骤任务中仍有 80.00% 的成功率。这个结果说明,物体中心的空间先验可以明显改善 VLM 对位置和朝向关系的执行能力。

在图像引导的餐具重排任务中,RAM 能根据单张目标图像推断空间关系,并把重排过程拆解为一串带约束的子任务。普通设置下,任务成功率为 92.00%;更困难的设置中,物体被放在不同高度平面上,成功率仍达到 72.00%。这说明系统已经从二维摆盘走向了三维关系的恢复和执行。

桌面清扫任务的平均成功率为 65%。这个数字没有前两类任务亮眼,却很有讨论价值。因为它涉及工具选择、空间可行性和隐含物理约束,失败空间更大。对于工具智能研究,这类结果反而更值得盯住:当工具尺寸、接触位置和动作顺序共同决定成败时,机器人需要的已经是工具、环境和目标之间的关系推理。

论文还在 CO3D 数据集上验证了视觉落地模块对未见物体类别的泛化能力,并进一步构建了一个包含 100 个样本的空间 VQA 数据集,覆盖位置关系、判断、旋转、规划和测量五类问题。结果显示,RAM 相比直接使用 VLM 的基线,在这些空间理解任务上整体表现更好。

图4 成功率结果图和 CO3D/VQA 对比图

五、局限与展望

RAM 的优点很清楚,它让 VLM 的计划有了可解释的空间依据,也让机器人运动规划有了更明确的目标。但这套系统仍然存在几个现实边界。论文讨论中提到,可靠性会受上游二维分割误差、VLM 长时序规划中的次优逻辑,以及下游运动学约束没有充分进入高层推理等因素影响。

另一个挑战来自知识库本身。每一类物体都需要准备标准模板和功能先验。对于几十类常见物体,这样做完全可行;如果扩展到大规模日常物体或工业工具,人工建库的成本会迅速上升。论文也指出,未来可以从人类交互视频、产品说明书和大规模三维物体数据中自动学习这些模板。

六、启发:表征可能比模型更关键

这篇论文带来的启发是,具身智能不能只依赖更大的模型,还要依赖更好的世界表征。很多机器人任务失败,并不是因为它听不懂任务,而是因为它不清楚物体的姿态、功能区域、空间关系和执行约束。RAM 将这些信息组织成对象中心的三维知识,再交给 VLM 进行任务分解,使模型的推理建立在更明确的物理结构之上。

这对我们后续研究也有借鉴意义。VLM 更适合承担意图理解、任务组织和常识推理,而空间表征、物理约束和执行验证需要由外部结构补足。真正可用的具身系统,可能不是单纯把感知、语言和动作全部压进一个黑箱模型,而是让模型能够调用清晰的对象表征、场景约束和反馈信息。这样系统既更容易泛化,也更容易解释和调试。


【论文信息】

标题:A retrieval-augmented framework enabling VLM spatial awareness for object-centric robot manipulation

作者:Kai Chen, Chengkun Li, Chang Tu, Jiahui Pan, Yiyao Ma, Wei Chen, Zhongxiang Zhou, Xuecheng Xu, Stephen James, Chi-Wing Fu, Rong Xiong, Pieter Abbeel, Yun-Hui Liu, Qi Dou

期刊:Science Robotics

在线日期:2026年4月29日

DOI:10.1126/scirobotics.aea2092

关键词:检索增强操作;视觉语言模型;三维空间感知;物体中心表示;机器人操作;工具智能

【参考来源】

Science Robotics 论文页面:https://www.science.org/doi/10.1126/scirobotics.aea2092

CUHK T Stone Robotics Institute 项目简介:https://ri.cuhk.edu.hk/en/research/projects/a-retrieval-augmented-framework-enabling-spatial-awareness-in-vlm-for-object-centric-robot-manipulation

论文数据与代码材料:Zenodo,https://doi.org/10.5281/zenodo.19325674

实验室地址:湖北省武汉市华中科技大学机械科学与工程学院东楼B317  

邮政编码:430074 联系电话:15171466275  

电子邮箱: 819068551@qq.com  

版权所有:2017_AMI_WEBSITE HUST