Skip to main content
QUICK REVIEW

[论文解读] Learning Dexterous Manipulation from Suboptimal Experts

Rae Jeong, Jost Tobias Springenberg|arXiv (Cornell University)|Oct 16, 2020
Reinforcement Learning in Robotics参考文献 21被引用 12
一句话总结

本文提出相对熵Q学习(REQ),一种策略迭代算法,能够有效结合高度离策略的专家数据与高维机器人操作任务中的在线策略探索。通过利用学习到的先验分布的重要性采样并施加KL约束,REQ在离策略、离线学习和模仿学习设置中均优于强基线方法,实现了从次优专家(如组合的路径点控制器和学习到的基元)中样本高效的策略学习。

ABSTRACT

Learning dexterous manipulation in high-dimensional state-action spaces is an important open challenge with exploration presenting a major bottleneck. Although in many cases the learning process could be guided by demonstrations or other suboptimal experts, current RL algorithms for continuous action spaces often fail to effectively utilize combinations of highly off-policy expert data and on-policy exploration data. As a solution, we introduce Relative Entropy Q-Learning (REQ), a simple policy iteration algorithm that combines ideas from successful offline and conventional RL algorithms. It represents the optimal policy via importance sampling from a learned prior and is well-suited to take advantage of mixed data distributions. We demonstrate experimentally that REQ outperforms several strong baselines on robotic manipulation tasks for which suboptimal experts are available. We show how suboptimal experts can be constructed effectively by composing simple waypoint tracking controllers, and we also show how learned primitives can be combined with waypoint controllers to obtain reference behaviors to bootstrap a complex manipulation task on a simulated bimanual robot with human-like hands. Finally, we show that REQ is also effective for general off-policy RL, offline RL, and RL from demonstrations. Videos and further materials are available at sites.google.com/view/rlfse.

研究动机与目标

  • 解决在稀疏奖励和探索受限条件下,高维机器人操作中的样本效率挑战。
  • 开发一种统一的强化学习算法,有效利用来自次优专家和在线策略轨迹的混合数据分布。
  • 证明可通过组合学习到的基元和路径点控制器来构建次优专家,以应对复杂任务。
  • 表明将专家动作与策略动作交错执行,可在困难的操作环境中实现丰富的探索。
  • 在离策略强化学习、离线强化学习和模仿学习设置中验证REQ的有效性。

提出的方法

  • REQ是一种策略迭代算法,通过相对于学习到的先验策略的KL散度约束来优化策略。
  • 它使用重要性采样,从混合数据集(包含离策略专家数据和在线策略轨迹)中估计Q值。
  • 该算法通过KL正则化确保策略更新后仍与先验策略保持接近,同时最大化期望Q值。
  • 次优专家通过组合用于高层运动序列的路径点跟踪控制器和用于灵巧操作的已学习基元构建而成。
  • 交错探索通过在轨迹采样过程中交替使用策略动作与专家动作来实现,以提升状态覆盖范围。
  • 该方法在DeepMind Control Suite和使用模拟Shadow手的双臂LEGO堆叠任务上进行了评估。

实验结果

研究问题

  • RQ1单一强化学习算法能否有效结合高度离策略的专家数据与在线策略探索,从而提升高维控制任务中的样本效率?
  • RQ2如何以模块化且直观的方式构建次优专家,以应对复杂的灵巧操作任务?
  • RQ3将专家动作与策略动作交错执行,是否能带来比标准探索策略更优的探索效果和更快的收敛速度?
  • RQ4REQ是否能在无需任务特定调参的情况下,泛化至离策略、离线和模仿学习设置?
  • RQ5由基元与控制器组合而成的专家,在多大程度上能够引导复杂操作任务的学习?

主要发现

  • 在DeepMind Control Suite上,REQ优于D4PG、CRR和行为克隆等强基线方法,在9项任务中的6项中取得了最高回报。
  • 在具有挑战性的双臂LEGO堆叠任务中,REQfSE学习到的策略超越了次优专家的性能,证明了由组合行为有效引导学习的能力。
  • 在离线强化学习中,REQ达到最先进性能,Cartpole任务回报为860±7,Walker Stand任务为929±46,Fish Swim任务为592±41。
  • 使用交错探索显著提升了样本效率,使在标准探索失败的环境中也能实现学习。
  • REQ展现出强大的泛化能力,在无需架构或超参数调整的情况下,于离策略、离线和模仿学习基准上均表现优异。
  • 由学习到的基元和路径点控制器组合而成的次优专家,实现了有效的任务分解,并成功支持了在复杂高维任务上的策略学习。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。