Skip to main content
QUICK REVIEW

[论文解读] Diffusion-EDFs: Bi-equivariant Denoising Generative Modeling on SE(3) for Visual Robotic Manipulation

Hyunwoo Ryu, Jiwoo Kim|arXiv (Cornell University)|Sep 6, 2023
Generative Adversarial Networks and Image SynthesisComputer Science被引用 3
一句话总结

该论文提出了一种新型的SE(3)-等变扩散生成模型Diffusion-EDFs,用于视觉机器人操作,仅需5–10次人类示范即可在一小时内完成端到端训练。通过利用双等变性与分层架构,该方法实现了数据高效、可泛化的策略学习,具备更强的鲁棒性与在未见过的物体构型下的真实世界部署能力。

ABSTRACT

Diffusion generative modeling has become a promising approach for learning robotic manipulation tasks from stochastic human demonstrations. In this paper, we present Diffusion-EDFs, a novel SE(3)-equivariant diffusion-based approach for visual robotic manipulation tasks. We show that our proposed method achieves remarkable data efficiency, requiring only 5 to 10 human demonstrations for effective end-to-end training in less than an hour. Furthermore, our benchmark experiments demonstrate that our approach has superior generalizability and robustness compared to state-of-the-art methods. Lastly, we validate our methods with real hardware experiments. Project Website: https://sites.google.com/view/diffusion-edfs/home

研究动机与目标

  • 为解决现有扩散模型在机器人操作中面临的局限性,即需要大量示范数据且对分布外构型缺乏泛化能力。
  • 开发一种在SE(3)上具有双等变性的扩散模型,以保留旋转与平移对称性,从而提升数据效率与鲁棒性。
  • 与先前的能量基模型(如EDFs)相比,显著缩短训练时间,同时保持端到端可训练性与泛化能力。
  • 通过分层架构实现场景级上下文理解,捕捉点云观测中的长程依赖关系。
  • 通过在多样化操作任务上的综合仿真与真实机器人实验验证该方法的有效性。

提出的方法

  • 该方法采用基于分数的生成模型,以3D点云观测为条件,其学习到的分数函数在SE(3)变换下具有双等变性。
  • 采用分层架构,结合局部与全局特征表示,以捕捉点云输入中的细粒度与场景级上下文信息。
  • 通过去噪过程进行模型训练:末端执行器位姿被逐步破坏,随后在SE(3)流形上使用基于分数的扩散过程进行重建。
  • 通过基于不可约表示(自旋-0至自旋-l)的SO(3)-等变消息传递层强制实现双等变性,确保在旋转与平移下行为的一致性。
  • 采用多尺度去噪头以实现高分辨率位姿生成,且为抓取与放置子任务分别训练独立模型。
  • 在采样后使用基于能量的判别器对多个扩散采样结果进行排序与筛选,以选择高质量的抓取位姿。
Figure 1 : Overview of Diffusion-EDFs. (a) The target end-effector pose $g_{0}$ is bi-equivariantly diffused for the training of Diffusion-EDFs. (b) The end-effector pose is sampled from the policy by denoising with learned bi-equivariant score function. Due to the bi-equivariance, the trained polic
Figure 1 : Overview of Diffusion-EDFs. (a) The target end-effector pose $g_{0}$ is bi-equivariantly diffused for the training of Diffusion-EDFs. (b) The end-effector pose is sampled from the policy by denoising with learned bi-equivariant score function. Due to the bi-equivariance, the trained polic

实验结果

研究问题

  • RQ1基于扩散的生成模型能否仅通过5–10次人类示范实现数据高效、端到端的6-DoF机器人操作策略学习?
  • RQ2在扩散模型中引入SE(3)-双等变性如何提升对未见过的物体位姿与构型的泛化能力?
  • RQ3所提出的方法能否与先前的能量基模型(如EDFs)相比显著缩短训练时间,同时保持性能?
  • RQ4该分层架构在多大程度上增强了模型对点云观测中场景级上下文的推理能力?
  • RQ5该方法在涉及新型物体实例、对抗性干扰物与非标准物体朝向的真实世界场景中,泛化能力如何?

主要发现

  • Diffusion-EDFs仅使用5至10次人类示范,即可在不到一小时内完成有效的端到端训练,相比先前的EDF方法提速15倍。
  • 该方法对分布外构型具有稳健的泛化能力,包括未见过的物体位姿(如倾斜朝向)与新型物体实例,在人工评估中成功率超过90%。
  • 在马克杯挂衣架、碗放盘子、瓶子放架子等真实机器人任务上的实验验证了该方法从原始点云观测中生成有效抓取位姿的能力,且监督程度极低。
  • 采样时间根据场景复杂度在5–10秒(20个抓取位姿)与9–17秒(10个放置位姿)之间变化,复杂场景(如碗放盘子)的推理时间更长。
  • 使用RTX 3090 GPU训练时,马克杯抓取耗时不足24分钟,马克杯放置耗时不足36分钟,酒瓶抓取耗时27分钟,碗放置最多耗时1.3小时;通过三块GPU并行训练子任务模型,总训练时间缩短至一小时以内。
  • 分层架构使模型能够区分场景级上下文,在复杂杂乱环境中相比以物体为中心的方法性能更优。
Figure 2 : Architecture of multiscale EDF. Our multiscale EDF model is composed of a feature extracting part and a field model part. See Fig. 7 in Supp. D.3 for details on each module in the architecture. (a) The feature extractor encodes the input point cloud into multiscale featured point clouds.
Figure 2 : Architecture of multiscale EDF. Our multiscale EDF model is composed of a feature extracting part and a field model part. See Fig. 7 in Supp. D.3 for details on each module in the architecture. (a) The feature extractor encodes the input point cloud into multiscale featured point clouds.

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。