回顾我们之前聊过的所有酷炫技术——模仿学习、Sim-to-Real、强化学习、LLM任务规划——你会发现,它们都像一个个饥肠辘辘的巨兽,吞噬着一个共同的东西:数据。
互联网上有万亿级文本和图片来训练ChatGPT和Midjourney。但机器人需要的不是“看图识字”,而是在物理世界中行动的完整轨迹。这就像试图通过看菜谱就学会颠勺——你缺少了锅的重量、油的温度和食材的触感。
于是,为机器人“造数据”,成了具身智能时代最基础、也最核心的基础设施工程。今天,我们就来一次“具身智能数据集”的全景扫描,看看研究者们如何从单一的视觉,一路覆盖到最细腻的触觉。
在展开全景图之前,我们先回答一个问题:为什么不能像训练大语言模型那样,直接从网上“爬取”机器人数据?
根本原因在于,机器人数据是“具身的”。它天然包含四个维度:
多模态:不只是图像,还有关节角度、电机电流、力传感器、触觉读数……
时间序列:不是静态图片,而是一连串“观察-动作-新观察”的闭环序列。
物理交互:必须包含与物体的接触、碰撞、摩擦力等真实物理反馈。
形态绑定:一个数据在七轴机械臂上采集,就很难直接用在五指灵巧手上。
这些特性决定了,机器人数据无法“下载”,只能“制造”。
视觉是当前具身智能数据的绝对主力,它又可以细分为几个层次:
1、RGB视频:最基础的“眼睛”
这是门槛最低、积累最多的数据类型。就像我们平时录视频一样,记录下机器人第一视角或第三视角的彩色画面。
代表性数据集:Something-Something V2 包含了22万个人类手部操作物体的视频,虽然是人手,但可以帮助机器人理解“推”、“拉”、“掀开”等动作的视觉含义。更大规模的Ego4D则采集了数千小时的人类第一人称日常活动视频,是具身理解的重要基石。
局限:单纯的RGB只有颜色信息,没有深度,无法感知三维空间距离。
2、深度图与点云:进入三维世界
为了让机器人知道“物体离我多远”,我们需要深度信息。
代表性数据集:ScanNet提供了1500多个室内场景的RGB-D(彩色+深度)扫描。机器人可以在这些虚拟房间里反复“漫游”,学习三维几何空间的结构。GraspNet则是一个百万级规模的抓取姿态数据集,直接告诉机械臂“从这个角度、这个距离伸过去抓,成功率最高”。
关键能力:从二维图像理解到三维空间推理。
3、视频-动作对:模仿学习的“教材”
这是模仿学习最直接的燃料——看到画面,知道当时执行了什么动作。
代表性数据集:RoboNet 是早期的先驱,它汇集了7个不同机器人、在不同环境下的15万次抓取尝试的视频。它试图让模型从这些跨机器人、跨场景的交互中,学到一种通用的“视觉-运动”关联。
里程碑:Open X-Embodiment (OXE):这是Google DeepMind领衔的“超级工程”。他们说服全球几十个顶尖实验室,共享了各自采集的机器人操作数据,最终汇集了一个包含 100多万条真实机器人轨迹 的巨型数据集。这是机器人领域的“ImageNet时刻”,它让训练一个“通用机器人基础模型”变得可能。不同的机械臂、不同的相机、不同的任务——模型第一次看到如此丰富的物理世界。
如果你闭上眼,手却依然能轻松地捏起一块豆腐而不捏碎——这就是触觉的魔力。对于精细操作,视觉是“远观”,触觉才是真正的“交互”。
1、触觉传感器:机器人的“指尖神经”
触觉数据的采集,依赖专门的传感器。目前主流的有:
GelSight:类似一小块柔软的橡胶,背面有高精度摄像头。当它接触物体,摄像头会拍摄橡胶的形变,从而重建出接触面的微观几何形状和力的分布。轻轻放在一粒米上,它就能看清米粒的纹理。
BioTac:模拟人类指纹,内部有液体和电极,能同时感知压力、振动和温度。
2、代表性数据集:让机器人“摸”懂世界
Something-Something与GelSight的结合:研究者在人手上也贴上GelSight传感器,让人去摸各种物体和纹理,同时记录视觉画面和触觉信号。这让机器人学会了“看到一颗草莓,就自动调用轻轻拿捏的触觉模式”。
Tactile-Enabled Grasping:这类数据集专门记录“成功的抓取”与“失败的抓取”对应的触觉变化。机器人通过对比学习,就能“摸”出物体是否快要滑落,并瞬间增加握力。
触觉数据是当前最稀缺、也最具价值的“数据蓝海”,它将机器人从“看着做”升级为“感觉着做”。
真正的具身智能,需要所有感官打通并协同工作。这催生了最新的全模态数据集。
代表性工作:RH20T 这是一个包含 11万条 真实机器人操作轨迹的数据集,其特点是 “一应俱全”:
视觉:多路RGB-D相机流。
触觉:指尖GelSight触觉传感器数据。
音频:麦克风记录的摩擦、碰撞声(这对识别“拧紧了没”很有用)。
执行器:关节角度、电流、扭矩、夹爪开合度。
语言:每一步操作对应的人类语言指令。
这种全模态数据集,让研究者可以训练出能结合视觉、触觉和语言进行综合决策的模型。它不再是“眼睛”或“指尖”的单打独斗,而是一个真正感官协调的“智能体”在成长。
在具身智能的世界里,数据的丰度,决定了能力的上限。
我们正在见证一场大规模的“数据基建”运动。从静态的RGB图像,到动态的视频-动作对,再到精密的触觉信号和跨模态融合,这场全景数据革命的目标只有一个:让机器人不再活在“看图说话”的实验室里,而是带着完整的感官,走进我们嘈杂、混乱、触手可及的,活生生的现实。