Skip to main content
QUICK REVIEW

[论文解读] Beyond Pick-and-Place: Tackling Robotic Stacking of Diverse Shapes

Alex X. Lee, Coline Devin|arXiv (Cornell University)|Oct 12, 2021
Reinforcement Learning in Robotics被引用 16
一句话总结

本文提出了RGB-Stacking,这是一个包含152个3D打印物体的多样化基准,用于机器人堆叠任务,并提出了一种基于视觉的强化学习(RL)框架,具备仿真到现实的迁移能力以及离线RL微调。该方法通过领域随机化和交互式策略蒸馏,在真实世界中实现了对非立方体形状物体的鲁棒堆叠,经过离线RL微调后,对未见过的物体组合表现出高成功率,展示了良好的泛化能力。

ABSTRACT

We study the problem of robotic stacking with objects of complex geometry. We propose a challenging and diverse set of such objects that was carefully designed to require strategies beyond a simple "pick-and-place" solution. Our method is a reinforcement learning (RL) approach combined with vision-based interactive policy distillation and simulation-to-reality transfer. Our learned policies can efficiently handle multiple object combinations in the real world and exhibit a large variety of stacking skills. In a large experimental study, we investigate what choices matter for learning such general vision-based agents in simulation, and what affects optimal transfer to the real robot. We then leverage data collected by such policies and improve upon them with offline RL. A video and a blog post of our work are provided as supplementary material.

研究动机与目标

  • 解决在真实世界中使用基于视觉的机器人策略堆叠复杂非立方体物体的挑战。
  • 开发一种可扩展、可泛化的机器人操作基准,超越简单的抓取与放置任务。
  • 研究仿真超参数和领域随机化对真实世界迁移性能的影响。
  • 评估离线强化学习在提升通过仿真到现实迁移训练的策略方面的有效性。
  • 发布一个完全可复现的基准,包含3D打印物体、仿真环境和真实世界设置的文档。

提出的方法

  • 提出一种在仿真环境中使用领域随机化训练的基于视觉的强化学习框架,以提升仿真到现实的泛化能力。
  • 采用交互式策略蒸馏,将感知策略学习与技能获取解耦,实现在无需显式示范的情况下模仿人类示范。
  • 使用配备RGB相机和本体感觉的4自由度机械臂,收集真实世界数据用于离线强化学习微调。
  • 在训练过程中应用图像增强和领域随机化,以提升对真实世界视觉变化的鲁棒性。
  • 利用大规模真实世界数据(超过54,000次尝试)训练离线强化学习智能体,使其在初始仿真到现实策略的基础上进一步提升性能。
  • 发布一个完整的基准,包含152个程序化生成并3D打印的物体、仿真环境以及真实世界硬件说明。

实验结果

研究问题

  • RQ1单一基于视觉的策略是否能在真实世界堆叠中泛化到多样化的非立方体物体组合?
  • RQ2仿真超参数和领域随机化如何影响机器人堆叠任务的真实世界性能?
  • RQ3当使用从仿真到现实策略收集的数据与从脚本化智能体收集的数据进行离线强化学习微调时,性能提升效果有何差异?
  • RQ4交互式策略蒸馏在无需人类示范的情况下,如何促进感知感知意识的策略学习?
  • RQ5物体几何设计如何影响堆叠难度以及复杂策略的出现?

主要发现

  • 在仿真中通过领域随机化和交互式蒸馏训练的单一基于视觉的策略,在真实世界中对五组不同的物体组合均实现了高成功率,展示了超越简单抓取与放置任务的泛化能力。
  • 离线强化学习微调显著提升了使用仿真到现实策略收集的数据的性能,但当应用于脚本化智能体收集的数据时性能反而下降。
  • 该方法通过端到端强化学习训练成功学习了多样的堆叠策略(如使用顶部物体翻转其他物体),表明其在接触动力学方面具备潜在的涌现推理能力。
  • 该基准RGB-Stacking支持超过10,000种可能的堆叠组合,并包含一组在定量上比训练物体更具挑战性的保留测试物体。
  • 通过超过54,000次真实世界尝试的广泛消融实验表明,领域随机化和图像增强对仿真到现实迁移的成功至关重要。
  • 发布的基准包含完整的仿真环境、3D打印物体设计以及详细的现实世界硬件文档,实现了完全可复现性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。