[论文解读] One-shot Imitation Learning via Interaction Warping
本文提出了一种名为 Interaction Warping 的一次性模仿学习方法,用于 SE(3) 机器人操作,通过 Coherent Point Drift (CPD) 对新实例的对象形状和交互关键点进行形变,实现跨多样化对象形状和姿态的泛化。该方法仅需一次示范即可在仿真和真实世界任务中成功泛化,其成功率和数据效率均优于先前方法。
Imitation learning of robot policies from few demonstrations is crucial in open-ended applications. We propose a new method, Interaction Warping, for learning SE(3) robotic manipulation policies from a single demonstration. We infer the 3D mesh of each object in the environment using shape warping, a technique for aligning point clouds across object instances. Then, we represent manipulation actions as keypoints on objects, which can be warped with the shape of the object. We show successful one-shot imitation learning on three simulated and real-world object re-arrangement tasks. We also demonstrate the ability of our method to predict object meshes and robot grasps in the wild.
研究动机与目标
- 解决仅用一次示范将机器人操作策略泛化到 3D 空间中新型对象实例和任意姿态的挑战。
- 克服先前基于关键点的方法的局限性,这些方法需要大量预训练或依赖神经网络进行描述子学习。
- 通过联合推断形状、姿态和交互点,实现跨物体类别的稳健策略迁移,利用非刚性点云配准技术。
- 在仿真和真实世界机器人操作任务中验证该方法的有效性,包括非结构化环境中的物体重排和抓取预测。
提出的方法
- 使用 Coherent Point Drift (CPD) 对从单次示范中获得的规范物体模型,非刚性地注册新类别内的对象实例。
- 将操作动作表示为物体表面的关键点,这些关键点与物体形状同步形变,以保持空间和语义一致性。
- 使用 CPD 训练形状补全模型,通过将未见对象实例与规范形状对齐,推断其 3D 网格。
- 通过应用相同的 CPD 变换,将规范任务策略投影到新场景中,形变对象网格和交互关键点。
- 将该方法与开放词汇感知流水线(如 Detic 和 Segment Anything)结合,从 RGB-D 图像中检测、分割并重建物体网格。
- 利用形变后的网格和关键点执行考虑碰撞的运动规划,并在非结构化的真实世界场景中预测机器人抓取。
实验结果
研究问题
- RQ1一次示范是否能在 3D 操作任务中泛化到具有任意形状和姿态的新对象实例?
- RQ2与神经描述子学习相比,通过 CPD 进行形状形变在一次性模仿学习中的数据效率和成功率方面表现如何?
- RQ3交互形变在真实世界杂乱环境中将示范抓取泛化到未见对象的程度如何?
- RQ4该方法是否能从原始 RGB-D 图像中准确预测 3D 网格和机器人抓取,而无需预分割或预标注数据?
主要发现
- Interaction Warping 在仿真和真实世界设置中,仅用一次示范,即可在一次性的物体重排任务(如水杯放在树上、碗放在水杯上、瓶子放入盒子)中实现超过 90% 的成功率。
- 该方法优于 R-NDF 和 TAX-Pose,后者需要五次或更多示范才能达到相近的成功率,且即使在多次示范下也常无法超过 80% 的成功率。
- IW 可成功泛化到具有显著形状差异的新对象实例,包括不同形状的水杯和树木,并能处理真实世界设置中的姿态变化。
- 该方法对噪声和遮挡的点云具有鲁棒性,在真实世界试验中优于 (R-)NDF,后者在部分和低质量点云下频繁发生碰撞失败。
- 通过结合开放词汇检测与分割和形状形变,实现了在非结构化环境中的抓取预测,仅从单张 RGB-D 图像即可实现准确的网格和抓取预测。
- 形状与姿态的联合推断在 RTX 2080 Ti GPU 上每对象耗时约 25 秒,但该方法完全可微分,未来可通过神经摊销技术实现加速。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。