Skip to main content
QUICK REVIEW

[论文解读] Solving Challenging Dexterous Manipulation Tasks With Trajectory Optimisation and Reinforcement Learning

Henry Charlesworth, Giovanni Montana|arXiv (Cornell University)|Sep 9, 2020
Robot Manipulation and Learning被引用 5
一句话总结

本文提出了一套具有挑战性的灵巧操作任务基准,涵盖物体传递和笔旋转等任务,现有强化学习(RL)与轨迹优化(TO)方法均无法解决。本文提出一种新型轨迹优化算法(TOPDM),显著优于以往方法,并结合次优TO生成的示范与离策略强化学习(TD3),实现更优性能——成功实现稳定、无限次的笔旋转,该任务甚至对人类而言也极具挑战。

ABSTRACT

Training agents to autonomously learn how to use anthropomorphic robotic hands has the potential to lead to systems capable of performing a multitude of complex manipulation tasks in unstructured and uncertain environments. In this work, we first introduce a suite of challenging simulated manipulation tasks that current reinforcement learning and trajectory optimisation techniques find difficult. These include environments where two simulated hands have to pass or throw objects between each other, as well as an environment where the agent must learn to spin a long pen between its fingers. We then introduce a simple trajectory optimisation that performs significantly better than existing methods on these environments. Finally, on the challenging PenSpin task we combine sub-optimal demonstrations generated through trajectory optimisation with off-policy reinforcement learning, obtaining performance that far exceeds either of these approaches individually, effectively solving the environment. Videos of all of our results are available at: https://dexterous-manipulation.github.io/

研究动机与目标

  • 在仿真环境中创建一套新的具有挑战性的灵巧操作任务基准,涵盖双手协作与复杂指间操作(如笔旋转)。
  • 解决现有RL与轨迹优化方法在这些新任务上的失效问题,尤其在稀疏奖励、高维控制设置下。
  • 开发一种新型轨迹优化算法(TOPDM),在大多数任务上显著优于以往方法。
  • 将TOPDM生成的次优示范与离策略强化学习(TD3)结合,解决最困难的任务——PenSpin,该任务单独使用任一方法均无法成功。
  • 证明:即使是由系统自动生成的不完美示范,也能显著提升复杂灵巧操作任务中RL的性能。

提出的方法

  • 提出一种新型轨迹优化算法(TOPDM),在MPPI等现有方法基础上,通过引入动作耦合与轨迹的迭代优化,实现性能提升。
  • 采用无梯度、基于采样的方法,在高维动作空间中优化轨迹,重点处理机器人手操作中的复杂接触动力学。
  • 引入动作耦合(超参数β),在轨迹优化过程中促进多指间协调与自然运动。
  • 通过“示范重启”策略,将TOPDM生成的示范与离策略深度强化学习(TD3)结合,即RL智能体以TOPDM轨迹作为初始状态进行训练。
  • 采用奖励塑形策略,鼓励PenSpin环境中笔的持续旋转,稀疏奖励基于角速度与稳定性。
  • 通过每种方法进行10轮独立实验,利用中位数回报与置信区间评估性能的鲁棒性与泛化能力。

实验结果

研究问题

  • RQ1现有强化学习与轨迹优化方法能否解决涉及双手协作与复杂指间操作的新颖、高度挑战性的灵巧操作任务?
  • RQ2新型轨迹优化算法(TOPDM)是否能在这些新基准任务上显著超越现有TO与RL方法?
  • RQ3将TOPDM生成的次优示范与离策略强化学习(TD3)结合,是否能带来超越单一方法性能的提升?
  • RQ4在高维连续控制中,动作耦合(β)对提升轨迹质量与后续RL训练的重要性如何?
  • RQ5通过TO与RL联合训练的系统,能否在如“在指间无限旋转笔”这类极高难度任务上实现稳定、长期的性能表现?

主要发现

  • PenSpin任务极具挑战性:MPPI与TD3单独使用时均无法实现任何稳定的旋转,中位数回报接近零。
  • TOPDM显著优于现有TO方法,在几乎所有试验中成功实现笔旋转,但无法在全部250个时间步内维持连续旋转。
  • 将TOPDM示范与TD3结合(通过示范重启)后,所获得的策略中位数回报显著高于任一方法单独使用,其中8/10次试验优于TD3基线。
  • 动作耦合参数β至关重要:β = 0.7时成功率达8/10,而β = 1.0(无耦合)时仅1/10成功,表明耦合能显著提升策略泛化能力。
  • 最终使用TOPDM示范训练的TD3策略可将笔无限旋转,超过标准250步的episode长度,展现出强大而持久的性能。
  • 该结果是迄今为止最令人瞩目的自主系统学习复杂灵巧操作任务的案例之一,其难度可与人类水平相媲美。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。