1. 概述
近年来,大规模预训练模型在自然语言处理和多模态感知等领域取得了显著突破,展现出了强大的环境理解、逻辑推理和知识泛化能力。这些进展为具身智能的发展提供了重要支撑,并注入了新的动力。
具身智能系统以“感知-规划-行动”闭环范式组织核心架构,其运作机制可解构为三个层次:
- 感知层:通过物理本体的多模态感知系统(包括但不限于视觉、触觉、力觉等传感模态),对环境约束进行动态表征与语义理解。
- 规划层:基于本体形态学特征(如机械臂的自由度配置、人形机器人的仿生关节结构或移动机器人的运动学模型)以及任务具体特性实施任务解耦与路径规划,生成同时满足本体运动学、时空环境配置以及任务特性约束的可行策略。
- 执行层:通过驱动本体实现物理交互,同时构建实时反馈回路,对任务执行效果进行量化评估以驱动策略迭代。
通过利用海量多模态数据进行预训练的大模型,能够在多个层面实现同步优化:在感知阶段提升特征提取效率,在规划阶段增强任务分解的有效性,在执行阶段提高运动控制的精度。这种从数据空间到物理空间的映射迁移能力,使智能体能够有效应对结构化场景中的确定性约束以及非结构化环境中的突发扰动,从而实现具身智能系统在“环境理解-规划生成-动态执行”全链路上的协同优化。
2. 跨模态感知与表征学习
大模型赋能的感知系统通过处理多元传感器输入的数据,实现特征提取与跨模态信息融合,进而挖掘出支撑规划与执行的关键环境信息,为具身智能体的泛化性能提供支持。相关方法可分为显式与隐式两类。
2.1 显式方法
显式方法优先分析物体与场景状态,获取物体位姿、可操作区域及场景属性等信息,并将结果传递给下游规划与执行模块:
- SAM-6D:利用预训练分割模型 SAM 的零样本能力,实现了对新物体的 6D 位姿估计,突破了类别依赖限制。
- AffordanceLLM:结合大模型的世界知识与 3D 几何信息,通过视觉语言模型(VLM)生成可操作性图。
- AffordanceDiffusion:基于扩散模型,从单张 RGB 图像生成合理的人手-物交互图像,并提取可行的 3D 手部姿态。
- ReKep:利用视觉模型识别场景关键点(如把手、杯缘),并通过大语言模型将其约束关系转化为数学规则,指导任务执行中的空间关系维护。
2.2 隐式方法
隐式方法则直接利用大模型对感知信息的特征表达,支持下游规划与执行任务:
- PIE-G:通过传统图像预训练数据集训练视觉编码器,利用编码后的向量学习值函数和策略。
- PVR:将监督或自监督学习到的视觉表征直接用在强化学习框架中,用于提升具身策略学习的效果。
此外,面向具身智能的感知大模型常使用第一人称视角的人类操作数据,如 Ego4D、Something-Something 等,进行预训练。由于第一人称视角与机械臂操作高度相似,所学习到的表征更加利于迁移:
- R3M:使用视频序列中的时序关系,以及语言-视频的相关关系构造对比学习损失,获得的预训练模型可以和模仿学习或强化学习算法结合,用于机械臂操控。
- Voltron:利用语言描述与人类操作视频,通过视频重建与文本预测,同时学习底层与高层特征以支持下游具身任务。
3. 智能决策规划
大模型赋能的高层任务规划依据环境约束和具身智能体的本体特性,对复杂的、长期的任务目标进行层次化的拆解。这一过程将生成一系列可进行策略学习的子任务序列。
在实践中,大语言模型(LLMs)凭借其对现实世界环境和机器人任务的高层次先验知识,能够通过思维链推理有效规划复杂任务。然而,大语言模型也面临缺乏真实世界交互能力,无法直接评估规划效果等问题,限制了其在具身环境中的有效性。
为此,研究者提出了多种改进方法:
- SayCan:使用预训练技能增强大语言模型,使其能够在特定场景下提供符合环境上下文的规划结果。
- InnerMonologue:引入环境反馈机制,通过碰撞检测、场景描述和任务成功反馈等来构建闭环系统,动态调整规划策略以应对复杂的环境。
- DoReMi:利用视觉语言模型作为检查器,在每一步验证场景约束是否满足。
- LLM-Planner:通过检索相似任务生成提示词,增强大语言模型对未见任务的规划能力,并支持基于环境观察的重新规划。
- RoboGPT:通过引入机器人规划数据集和重规划机制,进一步提升规划的有效性和准确性。
- SayPlan:利用三维场景图赋能大语言模型,并结合传统路径规划和重新规划方法确保规划结果可执行。
- VILA:直接利用视觉-语言模型(VLM),将视觉感知信息纳入任务推理与规划中。
- REPLAN:在视觉-语言模型的基础上进一步通过重新规划机制来提升模型准确性。
4. 动态运动控制
大模型赋能的底层任务执行通过与模仿学习等框架进行结合,实现执行策略的优化学习。依托大模型的多模态语义解析能力,在有限具身数据微调的基础上,可精准适配具体应用场景,显著降低策略训练对具身任务数据的需求规模。
4.1 VLA 模型路线
- ALOHA-ACT:沿用编码器-解码器架构,利用具身数据进行模仿学习,通过视觉数据编码直接生成控制序列。
- RT 系列:谷歌提出的 RT 系列通过更大语言模型和更多具身任务数据提升效果:
- RT-1:使用 EfficientNet-B3 提取视频帧特征,结合自然语言指令直接输出离散化动作。
- RT-2:将动作序列转化为文本标记,使视觉-语言模型可以直接输出操控动作,开启了视觉-语言-动作大模型的研究。
- RT-X:整合全球 60 多个实验室的机械臂数据,涵盖 22 个实体和 16 万种任务,显著提升了模型泛化能力。
- OpenVLA:构建了 7B 参数的视觉-语言-动作模型,利用 Open-X 数据集微调,提供开源解决方案。
- RobotFlamingo:在开源视觉-语言模型 Flamingo 基础上加入策略预测网络,直接输出动作。
- Octo:类似的开源 VLA 工作。
- SpatialVLA:针对复杂 3D 场景操作,引入 Ego3D 位置编码整合 3D 空间信息与 2D 语义信息,并通过自适应动作网络实现新场景微调。
- Hi Robot:利用层次化视觉-语言-动作大模型,同时实现复杂任务的规划与执行。
4.2 扩散模型路线
研究者们将大规模扩散模型的复杂分布建模能力引入智能体决策过程,主要用于直接生成具身智能体的动作序列:
- DP(Diffusion Policy):通过扩散模型的加噪与去噪过程,在视觉观测引导下理解最优动作序列分布,使智能体在复杂或动态环境中生成有效动作。
- 3D DP:进一步引入几何特征和物理约束,增强场景感知能力,使智能体在执行任务时考虑障碍物、物体形状及物理互动。
- π0 模型:利用视觉-语言模型编码视觉观测与语言指令,通过条件流匹配建模动作连续分布,训练动作专家模块将噪声转化为动作序列。
4.3 数据生成
生成式大模型还可为具身任务生成大量训练数据,缓解数据稀缺性挑战:
- GenSim:该框架利用大语言模型实现任务提出、环境构造、任务解决与数据采集的全流程自动化:首先根据任务描述生成仿真场景代码并验证可行性,随后构建任务库用于新任务检索与优化,最后采集专家数据训练模仿学习策略。
5. 总结与展望
通过上述分析可见,大模型作为具身智能的核心模块,在感知、规划与执行等层面展现出不可替代的价值。当前研究正致力于贯通这些层次,借助大模型重塑具身智能的系统架构。随着大模型训练技术与具身智能数据的深度融合,相关研究有望在新兴服务业、工业制造及新型农业等领域催生更多创新应用。
然而,这一过程中仍需应对多重挑战:通用性与适配性的权衡、高效快速与安全稳定的双重需求、跨域跨平台泛化性的瓶颈,以及伦理、法律与人类价值的考量。