Skip to main content
QUICK REVIEW

[论文解读] DexPoint: Generalizable Point Cloud Reinforcement Learning for Sim-to-Real Dexterous Manipulation

Yuzhe Qin, Binghao Huang|arXiv (Cornell University)|Nov 17, 2022
Robot Manipulation and Learning被引用 12
一句话总结

DexPoint 提出了一种基于点云输入的模拟到现实的强化学习框架,用于灵巧操作,实现了在真实世界中对新物体的零样本泛化。它引入了想象的手部点云增强和基于接触的密集奖励,无需在真实世界中微调或使用真实物体状态,即可在抓取和开门任务中实现高成功率。

ABSTRACT

We propose a sim-to-real framework for dexterous manipulation which can generalize to new objects of the same category in the real world. The key of our framework is to train the manipulation policy with point cloud inputs and dexterous hands. We propose two new techniques to enable joint learning on multiple objects and sim-to-real generalization: (i) using imagined hand point clouds as augmented inputs; and (ii) designing novel contact-based rewards. We empirically evaluate our method using an Allegro Hand to grasp novel objects in both simulation and real world. To the best of our knowledge, this is the first policy learning-based framework that achieves such generalization results with dexterous hands. Our project page is available at https://yzqin.github.io/dexpoint

研究动机与目标

  • 实现可泛化的灵巧操作策略,使其能够从仿真环境迁移到真实世界,而无需真实世界数据或物体状态监督。
  • 克服由于真实机器人系统中存在遮挡、噪声以及缺乏接触传感器而导致的模拟到现实迁移挑战。
  • 训练一个单一策略,使其在推理阶段能泛化到多个物体类别,包括未见过的实例。
  • 通过仅依赖原始点云观测,消除对真实物体状态或完美检测器的依赖。
  • 通过基于接触的奖励设计,提升高维控制任务中的样本效率和学习稳定性。

提出的方法

  • 利用机器人的运动学模型,将真实世界点云观测与想象的完整手部点云相结合,以改善被遮挡手指的可见性。
  • 引入一种基于预测接触对的接触密集奖励信号,而无需将接触状态加入观测空间。
  • 使用 PointNet 主干网络端到端训练基于点云的策略,采用 PPO 算法处理原始 3D 观测。
  • 在仿真环境中采用多物体训练设置,以提升在不同物体类别和形状间的泛化能力。
  • 应用领域随机化和数据增强,以增强对传感器噪声和环境变化的鲁棒性。
  • 采用闭环控制策略,实时响应点云观测,避免依赖预计算的物体模型。

实验结果

研究问题

  • RQ1仅在仿真环境中纯端到端训练的基于点云的策略,能否实现对未见物体的零样本模拟到现实的灵巧操作迁移?
  • RQ2在遮挡场景下,通过想象的手部几何结构增强点云输入,是否能提升鲁棒性和样本效率?
  • RQ3在不依赖显式接触传感器输入的前提下,基于接触的密集奖励是否能提升学习稳定性和样本效率?
  • RQ4在仿真环境中进行多物体训练,如何影响策略在真实世界中对新物体类别的泛化能力?
  • RQ5仅使用点云观测训练的策略,在无法访问真实物体状态的情况下,其在真实世界任务中的泛化能力能达到何种程度?

主要发现

  • 在包含 26 种物体的混合类别中,该策略在真实世界抓取任务中实现了 0.87 ± 0.03 的成功率,优于 EigenGrasp 等基线方法。
  • 在开门任务中,该策略在训练门上实现了 0.72 ± 0.07 的成功率,在具有未见拉手形状的新门上实现了 0.67 ± 0.01 的成功率,证明了零样本泛化能力。
  • 消融实验表明,结合想象的手部点云和基于接触的奖励可达到最高性能,证实了两个组件的有效性。
  • 该方法实现了稳定的训练和成功的真实世界部署,且无需任何真实世界微调或访问真实物体状态。
  • 该策略在bottles上的泛化能力优于cans,可能是因为后者需要更复杂的多指协调,而想象的点云有助于在遮挡下解决此类问题。
  • 该方法是首个仅使用点云输入且无需真实世界数据,即实现模拟到现实灵巧操作类别级泛化的方案。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。