✨ 复制成功!

以文会友,打造好学人设!

📋 已复制到剪贴板:

扩散策略(Diffusion Policy)在机器人操作中具体是如何工作的?

创建时间:2026-08-12 更新时间:2026-08-12 阅读次数:1006 次

我们来深入聊聊扩散策略,这正是当前机器人模仿学习领域最火热的“新范式”,也常被称作机器人领域的“GPT时刻”之一。

要理解它,我们可以从一个完全不同的领域——AI绘画——说起。

从“充满噪点的乱码”到“清晰的行动”

你可能用过 Midjourney 或 Stable Diffusion。它们的核心就是扩散模型:先给一张清晰的猫的照片,一步步往上添加噪点,直到它变成一团完全随机的电视雪花点。然后,训练一个神经网络,学习如何把这个过程逆转——从一团混沌的噪点中,一步步“去噪”,还原出一张清晰的猫的照片。生成新图时,我们只需给网络一团纯噪点和一句“一只戴帽子的猫”,它就能从混沌中逐渐“浮现”出你想要的画面。

现在,把这个逻辑套用到机器人动作上,就是扩散策略的精髓。

概念AI绘画 (图像生成)机器人动作 (扩散策略)
数据清晰的照片一段平滑、连续的动作轨迹(如关节角度序列)
加噪过程让照片变成雪花噪点让平滑的动作轨迹变成完全随机的、抽搐的乱码
学习目标从噪点预测出清晰照片从随机乱码中,预测出能完成任务的平滑动作
执行方式输入噪点+文字,输出图像输入随机动作+视觉观察,输出可执行的动作序列
最终效果生成新图像在真实环境中,生成从未见过的、流畅的操作动作

简单说,扩散策略就是把生成一个流畅、稳定、能应对变化的动作序列,视为一个“逐步去噪”的过程。

为什么这个“拿来主义”会带来革命?

用扩散模型来生成动作,解决了传统模仿学习的三大痛点:

1、告别“抽搐”,动作极其平滑流畅

传统方法每0.1秒就输出一个瞬间动作,缺乏整体规划,容易抖动。扩散策略则一次性生成一整段(比如未来2-3秒)的动作序列,整个过程天然平滑,就像工业机器人里的顶级“老法师”。在处理倒咖啡、削皮等需要稳定性的精细活时,优势巨大。

2、天生善于处理“多模态”难题

这是最关键的一点。想象一个场景:机器人要把玩具捡回筐里,它可以走左边绕过去,也可以走右边绕过去。两种方式都正确,但传统模型可能会把两种模式“平均”掉,输出一个直直撞上障碍物的中间路线,导致失败。

而扩散模型由于其概率本质,天生就能学习和表达这种“多模态分布”。它会很自然地随机选择一种模式来执行,要么坚定走左边,要么坚定走右边,避免了致命的平均化。

3、与“大模型”架构天然契合

扩散策略内部可以极其方便地集成Transformer等架构,从而支持处理文本、图像等多模态信息。这让机器人像ChatGPT一样,具备了在高维、复杂输入下进行“思考”和“生成”的能力,可扩展性极强。

它是如何工作的?一个真实的“推”的过程

让我们通过哥伦比亚大学团队的开创性工作,来看一个“推动物块到指定点”的任务:

观察:机器人通过相机看到桌面和物块。

采样:在它的“大脑”里,未来2秒的推的动作序列,最初是一段毫无意义的随机噪声。

去噪:扩散策略网络开始工作。它像顶级的降噪耳机分析环境噪音一样,分析当前的桌面图像和这段带噪声的动作序列。它开始思考:“不对,当前这个角度会推空,要修正得更有针对性一点。”

迭代:通过几十次这样的迭代去噪,原本充满噪声、抽搐不停的动作序列,逐渐“清晰”,演变成一条优美、平滑的、能将物块准确推到目标点的轨迹。

执行:机器人执行这段已“去噪”的干净动作序列。而在此过程中,新的观察和去噪周期已在进行,形成连续的闭环控制。

依然存在的挑战:速度与可靠性的博弈

扩散策略并非完美。

速度瓶颈:它的“逐步去噪”是个迭代过程,需要几十甚至上百步推理,这导致了明显的计算延迟,对需要毫秒级反应的动态任务(如接住飞来的球)是巨大挑战。目前主要通过模型蒸馏等技术来加速。

可靠性挑战:作为概率模型,它偶尔会生成出界、掉落的危险动作,这在工业场景中是不可接受的。如何保证生成动作的稳定可靠,是走向应用的关键。

扩散策略正在快速进化,它让机器人不再仅仅是“复读机”,而成为了一个能理解变化、生成多样化灵巧行为的“创造者”。它从数据中学习的,已是一种近乎直觉的、物理接触的“艺术”。