Skip to main content
QUICK REVIEW

[论文解读] Dexterous Manipulation with Deep Reinforcement Learning: Efficient, General, and Low-Cost

Henry Zhu, Abhishek Gupta|arXiv (Cornell University)|Oct 14, 2018
Robot Manipulation and Learning参考文献 26被引用 19
一句话总结

本文展示了无需仿真、无需手工建模的端到端深度强化学习(DRL)方法,可在真实世界中直接训练低成本、多指灵巧机器人手完成复杂、高接触力的操控任务(如阀门旋转和开门),训练时间仅为4–7小时。若引入20次人类示范,训练时间可缩短至2–3小时,证明DRL是仿真与基于模型控制的实用且可扩展的替代方案。

ABSTRACT

Dexterous multi-fingered robotic hands can perform a wide range of manipulation skills, making them an appealing component for general-purpose robotic manipulators. However, such hands pose a major challenge for autonomous control, due to the high dimensionality of their configuration space and complex intermittent contact interactions. In this work, we propose deep reinforcement learning (deep RL) as a scalable solution for learning complex, contact rich behaviors with multi-fingered hands. Deep RL provides an end-to-end approach to directly map sensor readings to actions, without the need for task specific models or policy classes. We show that contact-rich manipulation behavior with multi-fingered hands can be learned by directly training with model-free deep RL algorithms in the real world, with minimal additional assumption and without the aid of simulation. We learn a variety of complex behaviors on two different low-cost hardware platforms. We show that each task can be learned entirely from scratch, and further study how the learning process can be further accelerated by using a small number of human demonstrations to bootstrap learning. Our experiments demonstrate that complex multi-fingered manipulation skills can be learned in the real world in about 4-7 hours for most tasks, and that demonstrations can decrease this to 2-3 hours, indicating that direct deep RL training in the real world is a viable and practical alternative to simulation and model-based control. \url{https://sites.google.com/view/deeprl-handmanipulation}

研究动机与目标

  • 开发一种可扩展、通用的端到端方法,用于在真实世界环境中训练灵巧机器人手完成复杂操控任务。
  • 通过端到端深度强化学习,消除对仿真环境、手工设计模型或任务特定策略设计的依赖。
  • 评估在极少先验假设下,直接在真实世界中进行训练的可行性与效率。
  • 研究少量人类示范在真实世界DRL中加速学习的潜力。
  • 在传感与驱动能力有限的低成本通用机器人硬件上验证该方法的有效性。

提出的方法

  • 使用无模型强化学习算法,端到端训练深度强化学习策略,直接从原始传感器观测映射到运动控制动作,无需任务特定模型。
  • 采用位置控制作为执行方案,因其相比力矩控制或高阶控制方案可减少振动并提升学习稳定性。
  • 采用基于到目标距离的奖励函数(例如,$ r_1 = -ig Vert heta - heta_{ ext{goal}} ig Vert_2 $),辅以稀疏奖励整形以促进收敛。
  • 应用DAPG算法并结合示范微调,利用触觉示范引导策略学习的初始阶段。
  • 在仿真环境中进行消融实验,以选择最优控制方案与奖励函数,再部署至真实世界。
  • 直接在真实硬件上训练策略,完整捕捉传感器噪声、执行器延迟与机械误差等真实系统特性。

实验结果

研究问题

  • RQ1无模型深度强化学习是否能在真实世界中直接学习复杂、高接触力的操控行为,而无需仿真或手工设计模型?
  • RQ2执行空间的选择(如位置控制与力矩控制)如何影响真实机器人硬件上的学习稳定性与性能表现?
  • RQ3少量人类示范在真实世界灵巧操控DRL中能在多大程度上降低样本复杂度?
  • RQ4不同的奖励函数整形策略如何影响真实世界训练中的学习速度与策略质量?
  • RQ5在传感与驱动能力有限的低成本通用机器人手上,是否可通过直接真实世界强化学习实现高灵巧操控?

主要发现

  • 通过仅使用任务奖励且不依赖仿真,真实世界中成功学习了如阀门旋转与翻转方块等复杂灵巧操控任务,训练时间达4–7小时。
  • 位置控制显著减少了振动,提升了学习的稳定性和速度,相比力矩控制或高阶控制方案表现更优。
  • 引入20次人类示范后,平均训练时间从4–7小时缩短至2–3小时,样本效率提升2倍。
  • 采用稀疏密集奖励(如 $ r_2 $)的奖励整形策略相比仅使用控制成本惩罚,能更有效地提升学习进度,后者会抑制探索并延缓收敛。
  • 即使未引入控制成本项,训练出的策略在真实世界中仍表现出安全且平滑的行为,表明在使用位置控制时,控制成本并非确保安全的必要条件。
  • 该方法可泛化至不同低成本机器人手及多种任务,包括刚性与柔性物体的操控,展现出广泛的适用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。