Skip to main content
QUICK REVIEW

[论文解读] Learning Complex Dexterous Manipulation with Deep Reinforcement Learning and Demonstrations

Aravind Rajeswaran, Vikas Kumar|arXiv (Cornell University)|Sep 28, 2017
Robot Manipulation and Learning被引用 4
一句话总结

本文提出DAPG,一种将人类示范整合到策略梯度训练中的深度强化学习方法,实现了在24自由度机械手上的复杂灵巧操作任务的样本高效学习。通过行为克隆进行预训练,并采用正则化损失进行微调,DAPG将样本复杂度降低至5小时以下的机器人经验,所获得的策略比基于奖励塑造的基线方法更具鲁棒性,且表现出更接近人类的动作特征。

ABSTRACT

Dexterous multi-fingered hands are extremely versatile and provide a generic way to perform a multitude of tasks in human-centric environments. However, effectively controlling them remains challenging due to their high dimensionality and large number of potential contacts. Deep reinforcement learning (DRL) provides a model-agnostic approach to control complex dynamical systems, but has not been shown to scale to high-dimensional dexterous manipulation. Furthermore, deployment of DRL on physical systems remains challenging due to sample inefficiency. Consequently, the success of DRL in robotics has thus far been limited to simpler manipulators and tasks. In this work, we show that model-free DRL can effectively scale up to complex manipulation tasks with a high-dimensional 24-DoF hand, and solve them from scratch in simulated experiments. Furthermore, with the use of a small number of human demonstrations, the sample complexity can be significantly reduced, which enables learning with sample sizes equivalent to a few hours of robot experience. The use of demonstrations result in policies that exhibit very natural movements and, surprisingly, are also substantially more robust.

研究动机与目标

  • 使无模型深度强化学习能够扩展到24自由度机械手的高维灵巧操作任务。
  • 将灵巧操作任务的深度强化学习样本复杂度降低到适合现实世界部署的水平。
  • 通过示范引入人类先验知识,提升策略的鲁棒性和自然性。
  • 为未来机器人操作与强化学习研究建立一套复杂灵巧操作任务的基准测试套件。

提出的方法

  • 使用通过虚拟现实收集的小规模人类示范数据,采用行为克隆对策略进行预训练。
  • 采用一种称为DAPG的DDPG变体对策略进行微调,该方法将示范纳入经验回放缓冲区,并应用正则化以保持与示范行为的接近性。
  • 使用优先经验回放和n步回报以提升样本效率和训练稳定性。
  • 在策略梯度目标中增加正则化项,以鼓励学习到的策略保持与示范轨迹的接近性。
  • 在包含不同物体属性(尺寸和质量)的环境集合上训练策略,以显式提升鲁棒性。
  • 使用稀疏的任务完成奖励,在四个复杂任务上评估性能:物体重定位、手部操作、工具使用和开门。

实验结果

研究问题

  • RQ1无模型深度强化学习是否能够在不依赖手工设计奖励塑造的情况下,解决24自由度机械手的复杂灵巧操作任务?
  • RQ2在高维控制设置中,人类示范在降低灵巧操作策略学习的样本复杂度方面有多有效?
  • RQ3与从零开始使用塑造奖励训练的策略相比,通过示范训练的策略是否表现出更高的鲁棒性和类人动作?
  • RQ4在具有不同物理属性的环境集合上进行训练,是否能进一步提升灵巧操作策略的鲁棒性?
  • RQ5与现有DRL基线方法(如DDPGfD)相比,DAPG算法在高维灵巧操作任务中是否显著提升了样本效率?

主要发现

  • 与从零开始使用塑造奖励训练相比,DAPG将样本复杂度降低了最多30倍,实现了在5小时以下机器人经验内的训练。
  • 与使用塑造奖励训练的策略相比,DAPG训练的策略对环境变化(如物体质量与尺寸变化)表现出显著更高的鲁棒性。
  • 使用示范可生成更平滑、更类人的动作,这些动作难以仅通过奖励塑造来指定。
  • 在所有四个基准任务中,DAPG均优于DDPGfD,表现出更快的收敛速度和更优的最终性能。
  • 在包含不同物理属性的环境集合上进行训练可进一步增强策略鲁棒性,且DAPG成功学习了在基线方法失败的此类挑战性设置下的策略。
  • 所提出的物体重定位、手部操作、工具使用和开门任务的基准测试套件,为未来灵巧操作研究提供了真实且具有挑战性的测试平台。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。