文献导读:当大模型真正接入机器人操作系统:ROS-LLM如何重构人、语言与机器人之间的关系

作者:王一帆时间:2026-08-10点击数:

导语

近年来,大语言模型进入机器人领域已经不算新鲜。从用自然语言生成任务规划,到根据图像选择动作,再到直接生成机器人控制代码,越来越多的工作试图让机器人“听懂人话”。但一个现实问题是:听懂指令,并不等于能够在真实机器人上稳定执行。

大语言模型给出的结果,最终必须落到具体的机器人硬件、传感器、控制器和运动规划模块中。它不仅要知道“下一步应该做什么”,还要知道机器人当前能做什么、环境发生了什么、上一步是否执行成功,以及任务失败之后该如何修正。

发表于《Nature Machine Intelligence》的论文《A robot operating system framework for using large language models in embodied AI》,尝试回答的正是这一问题。论文提出ROS-LLM框架,将大语言模型智能体与机器人操作系统ROS连接起来,使其能够调用机器人技能、读取环境反馈、接受人的纠正、学习新动作,并对已有技能进行自动优化。

这篇论文真正重要的地方,并不是再次证明“大模型可以控制机器人”,而是提出了一种更加完整的系统思路:大模型不应该直接取代机器人控制系统,而应该成为连接人、机器人技能、环境反馈与学习算法的高层智能中枢。

论文基本信息

题目

A robot operating system framework for using large language models in embodied AI

期刊

Nature Machine Intelligence

发表时间

2026年3月

主要对象

ROS支持的固定机械臂、移动操作机器人与四足机器人

核心模块

LLM智能体、原子动作库、环境观测、模仿学习、动作优化与人类反馈

开放资源

论文代码与实验数据公开,实验使用开源预训练大语言模型

正文

一、从“听懂人话”到“真正把事情做完”

近年来,大语言模型进入机器人领域已经不算新鲜。从自然语言任务规划、视觉问答,到代码生成和动作选择,越来越多的研究试图让机器人“听懂人话”。但一个现实问题是:听懂指令,并不等于能够在真实机器人上稳定执行。

大语言模型给出的结果,最终必须落到具体的机器人硬件、传感器、控制器和运动规划模块中。它不仅要知道“下一步应该做什么”,还要知道机器人当前能做什么、环境发生了什么、上一步是否执行成功,以及任务失败之后该如何修正。

发表于《Nature Machine Intelligence》的这篇论文,尝试回答的正是这一问题。作者提出ROS-LLM框架,将大语言模型智能体与机器人操作系统ROS连接起来,使其能够调用机器人技能、读取环境反馈、接受人的纠正、学习新动作,并对已有技能进行自动优化。


二、解决的传统机器人系统痛点

传统机器人系统通常由专业工程师完成任务拆解和程序开发。工程师先将复杂任务拆成抓取、放置、导航、开门等原子动作,再把这些动作组织成动作序列、状态机或行为树。普通用户只能调用预先设计好的功能,很难根据新任务修改系统。

这种模式在结构化工业环境中能够工作,但进入家庭、实验室、公共空间和危险作业环境后,会暴露出三个明显问题:

1.真实世界任务开放且持续变化,不可能被提前全部定义。

2.普通用户不会编写ROS程序,也缺少运动规划和控制知识。

3.一旦出现目标移动、感知错误或抓取失败,系统仍然依赖专业工程师介入。

ROS-LLM的思路是在ROS之上建立一个大语言模型智能体。用户通过自然语言描述目标,大模型结合机器人技能库和环境信息,选择或组合适当的原子动作,再通过ROS服务、Action和节点完成实际执行。

图1  ROS-LLM框架与传统机器人开发流程对比

图1上半部分是论文提出的ROS-LLM:专家只需在系统初始化阶段提供基础技能,之后普通用户即可通过自然语言提出任务、提供反馈,并通过遥操作或动觉示教补充新技能。图1下半部分则代表传统流程,其中复杂任务必须由专家完成拆解、编程和部署。


三、核心卖点:从固定技能调用走向可扩展的人机闭环

如果只用一句话概括,这篇论文的核心卖点是:它把大语言模型从一个“任务规划工具”,升级成了一个能够连接感知、规划、控制、学习、优化和人类反馈的机器人系统级智能体。

过去不少LLM机器人研究只能从固定技能集合中挑选动作。一旦任务需要新的动作,或者原有动作参数不适合当前环境,系统就会陷入困境。ROS-LLM尝试突破固定动作空间的限制。

论文中的原子动作并不限定具体实现方式。它既可以是一个简单的夹爪开合命令,也可以是运动规划器、控制器、强化学习策略或模仿学习策略。每个动作都配有自然语言描述和ROS调用接口,供大模型理解、选择和执行。

更重要的是,这个动作库并非静态。普通用户可以通过动觉示教或遥操作提供动作演示,系统学习出新的运动策略,再由用户为该技能补充名称和文字描述,最终将其加入原子动作库。由此,论文研究的已经不只是“大模型如何选择动作”,而是机器人怎样在人的参与下持续扩展、修正和优化自身能力。


四、代表性实验:系统价值如何被证明?

4.1 一句“帮我做杯咖啡”,被拆成十二个原子动作

在厨房场景中,用户只需输入“Can you make me a coffee?”,系统便将其自动分解为十二个原子动作,包括拿起杯子、放入咖啡机、打开咖啡机盖、打开橱柜、拿取咖啡、关闭盖子、归还物品并启动咖啡机等。整个动作序列不需要用户手动编程或提前指定。

图2  咖啡制作任务被自动分解为十二个原子动作

这个实验的意义并不只是展示一个“会做咖啡”的机械臂,而是说明长时序机器人任务的关键不一定是从零生成所有控制量,而是把已有的可靠技能进行合理组合。大语言模型承担的是高层任务理解与技能编排,底层连续控制仍由成熟的控制器和技能策略完成。

4.2 人在环反馈:重要的不是零错误,而是能够纠错和积累

论文在彩色方块重排实验中发现,随着任务复杂度增加,仅依靠大语言模型规划时,系统会出现选错物体、动作顺序错误或感知失败。加入人类反馈后,操作者可以直接告诉机器人应该操作哪个方块、动作顺序如何调整,或在感知失败后先复位机械臂再重新搜索。

更有价值的是,系统能够把之前的人类纠正写入后续任务上下文。在目标箱子被移动的实验中,机器人第一次抓取失败后,人提示其抓取前重新检查目标位置;第二次遭遇相同扰动时,系统能够主动完成位置核验,不再需要重复提醒。

 

图3  人类反馈、少样本提示与原子动作优化的实验结果

目前来看,这部分实验非常接近人机混合智能的核心:人不是一直操纵机器人关节的控制器,也不仅仅是数据标注者,而是在关键节点提供高价值信息;机器人负责计算、执行和经验复用,人负责目标设定、异常纠正和策略教学。

4.3 从连续遥操作到远程监督:控制权可以分层分配

论文还开展了跨地域远程控制实验:欧洲的操作者通过聊天界面,控制位于亚洲的机器人完成避障抓取和放置任务。尽管存在约2至3秒通信延迟,所有参与者仍完成了任务。实验还发现,当用户明确知道机器人具有哪些原子能力时,他们更倾向于使用逐步、简短的原子指令,而不是一次输入很长的复合命令。

这对遥操作研究尤其有启发。传统遥操作要求人持续发送连续控制信号,网络延迟、丢包和视角受限都会显著增加操作者负担。ROS-LLM体现的则是一种更高层的监督式遥操作:人表达意图并监督任务,机器人负责局部规划和底层控制。

  

图4  人类示教、机器人复现与远程监督控制示例

4.4 大模型与贝叶斯优化分工:让技能自动调优

论文还提出原子动作优化器。首先由大语言模型阅读机器人动作代码,识别可能影响性能的关键超参数并给出搜索范围;随后由贝叶斯优化在低维参数空间中寻找更优配置。

在机器人空气曲棍球实验中,优化后的策略在仿真中的击球成功率由34.0%提升至46.6%,迁移到真实机器人后达到52.0%,而人工调参结果为30.0%。这说明大模型并没有被当成最终的数值优化器,而是负责判断“哪些参数值得优化”,贝叶斯优化负责真正的数值搜索。


五、核心创新点与特色

这篇论文的每一个组成模块并非都具有全新的算法。例如ROS、行为树、动态运动基元、贝叶斯优化、语言反馈和大语言模型都已有较成熟的研究基础。但它能够发表在《Nature Machine Intelligence》,关键在于其贡献并不是单一算法增量,而是形成了具有普遍意义的系统范式。

5.1 解决跨方向系统问题

论文讨论的不是某一种机械臂或某一个任务,而是如何让大语言模型真正进入现实机器人软件生态。ROS覆盖感知、规划、控制、通信和硬件接口,因此,ROS-LLM相当于在既有机器人基础设施与新一代语言智能之间建立了一座可复用的桥梁。

5.2 提供完整闭环,而非单点演示

论文同时覆盖自然语言任务规划、环境观测、长时序技能组合、人类反馈纠错、模仿学习扩展技能、动作参数优化、故障恢复和远程监督控制。它不是把若干Demo并列呈现,而是把这些功能纳入同一框架。

5.3 实验覆盖多种机器人和真实任务

作者在固定机械臂、移动操作机器人和四足机器人上进行了实验,并覆盖厨房操作、桌面重排、化学实验、空气曲棍球、办公室取物和远程控制等场景。跨平台、跨任务验证显著增强了论文关于通用性和可扩展性的说服力。

5.4 开源与可复现提高了社区价值

论文使用开源预训练大语言模型完成全部实验,并开放框架代码和实验数据。对于系统论文而言,真正难复现的往往不是某个公式,而是模块之间的消息格式、调用逻辑、异常处理和执行链路。开源使这项工作更接近可继续扩展的研究基础设施。


六、研究启发

6.1 对人机混合智能的启发:研究“何时让人介入”

这篇论文说明,人可以在机器人系统中承担不同层次的角色:任务开始前定义目标,技能缺失时提供示教,执行过程中进行纠错,高风险情况下接管或监督,任务完成后提供评价。

因此,人机混合智能的研究重点不应只停留在“如何加入人”,而应进一步回答:在什么时间、以什么形式、让人提供什么信息,才能产生最大价值?

同样是人类反馈,“任务失败了”只提供二值结果;“抓取前重新检测目标位置”包含状态判断和动作逻辑;一段遥操作轨迹则直接提供连续动作示范。未来可以研究统一的人类反馈表示,将语言纠正、示范轨迹、接管行为与任务评价转化为机器人可学习的信息。

6.2 对人在环强化学习的启发:从全程参与转向事件触发

从强化学习角度看,ROS-LLM可以被理解为一个分层决策系统:底层原子动作类似Option或技能策略,大语言模型则在更长时间尺度上选择技能。

这为人在环强化学习提出了三个具体问题:第一,人的语言反馈如何用于奖励塑形、约束生成或策略更新;第二,如何根据不确定性、风险和失败检测,只在关键时刻请求人类介入;第三,长时序任务失败后,如何判断应该修改高层技能选择、低层动作参数,还是环境观测模块。

6.3 对遥操作的启发:遥操作既是控制方式,也是学习入口

传统遥操作强调实时运动映射,而未来遥操作可能更多关注任务级意图传递、多模态交互、自主与人工动态切换、操作者认知负荷管理,以及延迟环境下的局部自主。

遥操作不应只是机器人自主能力不足时的替代方案,也可以成为机器人学习的重要入口。人完成一次遥操作后,系统可以将轨迹学习为新技能;下次遇到类似任务时,机器人先自主执行,只在失败或置信度不足时请求人接管。

由此可以形成“遥操作示范—技能学习—自主执行—关键节点纠错—技能再优化”的闭环。这比单纯追求减少人的参与,更符合人机混合智能的思想:人的参与越来越少,但越来越关键、越来越高效。


七、论文仍然存在的不足与可继续深入的问题

尽管框架完整,这项工作距离真正可靠的通用机器人仍有明显距离。

· 提示词敏感:一些语义相近的表达可能导致不同动作选择,说明语言理解仍缺乏稳定性。

· 动作幻觉:大模型可能生成技能库中不存在的动作,需要更严格的动作约束和可执行性检查。

· 高维感知被压缩为文本摘要:图像、点云和时序信息在文本化过程中可能损失关键几何信息。

· 人类反馈主要通过提示词注入:尚未形成严格的奖励模型、偏好模型或长期策略更新机制。

· 安全与责任机制不足:当大模型生成错误计划时,系统需要更明确的安全屏障、验证和回退机制。

这些不足并没有削弱论文价值,反而指出了后续研究空间:如何将一次性的语言纠错转化为真正可积累、可泛化、可验证的机器人经验。


结语

这篇论文的人机混合智能研究的最大启发是,大语言模型与机器人的结合,不应停留在“让机器人听懂一句话”。真正有价值的系统还需要回答:机器人当前具备哪些能力,如何将复杂目标分解为可执行技能,环境变化后如何重新规划,技能缺失时如何向人学习,动作性能不足时如何自动优化,以及什么时候应该自主执行、什么时候应该请求人的帮助。

ROS-LLM提供了一套初步但相对完整的回答。它没有让大模型直接控制每一个关节,而是将大模型置于机器人系统高层,使其成为语言、感知、技能、控制和人类反馈之间的连接者。

实验室地址:湖北省武汉市华中科技大学机械科学与工程学院东楼B317  

邮政编码:430074 联系电话:15171466275  

电子邮箱: 819068551@qq.com  

版权所有:2017_AMI_WEBSITE HUST