Skip to main content
QUICK REVIEW

[论文解读] Grasping in the Wild:Learning 6DoF Closed-Loop Grasping from Low-Cost Demonstrations

Shuran Song, Andy Zeng|arXiv (Cornell University)|Dec 9, 2019
Robot Manipulation and Learning参考文献 41被引用 9
一句话总结

本文提出了一款低成本手持设备,用于在真实环境中收集多样化的6自由度抓取演示,从而实现端到端训练深度强化学习策略,以完成6自由度闭环抓取。通过使用基于动作视角的渲染技术模拟未来状态,并利用学习到的值函数选择最优动作,该系统在静态场景中实现了92%的成功率,在动态场景中(含移动物体)实现了88%的成功率。

ABSTRACT

Intelligent manipulation benefits from the capacity to flexibly control an end-effector with high degrees of freedom (DoF) and dynamically react to the environment. However, due to the challenges of collecting effective training data and learning efficiently, most grasping algorithms today are limited to top-down movements and open-loop execution. In this work, we propose a new low-cost hardware interface for collecting grasping demonstrations by people in diverse environments. Leveraging this data, we show that it is possible to train a robust end-to-end 6DoF closed-loop grasping model with reinforcement learning that transfers to real robots. A key aspect of our grasping model is that it uses "action-view" based rendering to simulate future states with respect to different possible actions. By evaluating these states using a learned value function (Q-function), our method is able to better select corresponding actions that maximize total rewards (i.e., grasping success). Our final grasping system is able to achieve reliable 6DoF closed-loop grasping of novel objects across various scene configurations, as well as dynamic scenes with moving objects.

研究动机与目标

  • 解决在真实世界环境中收集多样化、现实世界6自由度抓取演示以训练鲁棒操作策略的挑战。
  • 通过使用低成本、真实世界人类演示的数据,实现6自由度闭环抓取策略的端到端学习。
  • 通过在多样化人类演示数据上进行预训练,而非完全依赖机器人上的试错,提高学习效率与泛化能力。
  • 开发一种基于动作视角的渲染视觉前向模型,以模拟未来状态,从而在闭环控制中实现更优的动作选择。

提出的方法

  • 使用低成本手持RGB-D夹爪设备,在厨房、办公室等非结构化真实环境里收集6自由度抓取演示。
  • 通过经典视觉跟踪算法,从人类操作期间捕获的RGB-D视频中恢复6自由度抓取轨迹。
  • 使用深度神经网络建模一个值函数,将夹爪中心的视觉观测映射到预期的未来奖励。
  • 基于动作视角的渲染技术模拟每个候选动作下夹爪摄像头可能看到的画面,从而实现对未来的状态预测。
  • 策略利用学习到的值函数评估这些模拟状态,并以闭环方式选择能最大化预期累积奖励的动作。
  • 模型在人类演示数据上进行预训练,并在真实机器人数据上进行微调,以提升性能与泛化能力。

实验结果

研究问题

  • RQ1通过低成本设备收集的多样化、真实世界6自由度抓取演示,是否能提升端到端6自由度抓取策略的样本效率与性能?
  • RQ2基于动作视角的渲染在模拟未来状态以支持闭环6自由度抓取控制方面有多有效?
  • RQ3与在真实机器人上进行自监督试错相比,在人类演示数据上进行预训练是否能带来更快的收敛速度与更好的泛化能力?
  • RQ4结合学习到的值函数与基于动作视角的渲染,是否能实现在含移动物体的动态场景中稳健的6自由度抓取?
  • RQ5人类演示的多样性在多大程度上提升了策略在新型物体与新场景配置下的泛化能力?

主要发现

  • 该系统在静态场景中实现了92%的抓取成功率,在含移动物体的动态场景中实现了88%的成功率,优于先前的最先进方法。
  • 在人类演示数据上进行预训练相比从零开始使用机器人试错训练,能实现更快的学习速度与更高的最终性能。
  • 该模型在新型物体与复杂配置(包括从墙壁侧面抓取、从倾斜料箱中抓取)上表现出良好的泛化能力。
  • 在真实机器人数据上进行微调后,平均而言,不同场景配置下的性能提升了约18%。
  • 基于动作视角的渲染技术通过模拟未来视觉状态并选择能最大化预期奖励的动作,实现了有效的闭环控制。
  • 在真实世界中收集的多样化人类演示显著提升了策略的泛化能力与鲁棒性,相比有限的机器人收集数据具有明显优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。