Skip to main content
QUICK REVIEW

[论文解读] Learning Sparse Rewarded Tasks from Sub-Optimal Demonstrations

Zhuangdi Zhu, Kaixiang Lin|arXiv (Cornell University)|Apr 1, 2020
Reinforcement Learning in Robotics参考文献 32被引用 11
一句话总结

本文提出自适应模仿学习(SAIL),一种离策略模仿学习方法,通过结合专家示范与自生成轨迹,在稀疏奖励环境中实现高样本效率,并超越次优教师策略。SAIL 采用动态的、以探索为导向的目标函数,平衡模仿与探索,通过基于判别器的合成奖励,迭代地用更优的自生成轨迹替换表现较差的示范,从而在连续控制基准测试中实现接近最优的性能。

ABSTRACT

Model-free deep reinforcement learning (RL) has demonstrated its superiority on many complex sequential decision-making problems. However, heavy dependence on dense rewards and high sample-complexity impedes the wide adoption of these methods in real-world scenarios. On the other hand, imitation learning (IL) learns effectively in sparse-rewarded tasks by leveraging the existing expert demonstrations. In practice, collecting a sufficient amount of expert demonstrations can be prohibitively expensive, and the quality of demonstrations typically limits the performance of the learning policy. In this work, we propose Self-Adaptive Imitation Learning (SAIL) that can achieve (near) optimal performance given only a limited number of sub-optimal demonstrations for highly challenging sparse reward tasks. SAIL bridges the advantages of IL and RL to reduce the sample complexity substantially, by effectively exploiting sup-optimal demonstrations and efficiently exploring the environment to surpass the demonstrated performance. Extensive empirical results show that not only does SAIL significantly improve the sample-efficiency but also leads to much better final performance across different continuous control tasks, comparing to the state-of-the-art.

研究动机与目标

  • 解决在仅有有限且次优的专家示范条件下,在稀疏奖励环境中训练强化学习智能体的挑战。
  • 通过利用专家示范来降低无模型强化学习的样本复杂度,而无需依赖高质量或最优的专家数据。
  • 通过稀疏环境奖励引导的系统性探索,使智能体能够超越次优示范的性能。
  • 设计一种动态平衡模仿示范行为与探索新型、更高回报轨迹的学习目标。

提出的方法

  • SAIL 构建了一个双目标学习过程,结合分布匹配与对先前策略的探索性偏离,以避免对次优示范的过拟合。
  • 它使用判别器基于专家示范与自生成轨迹之间的占用度量匹配,生成合成奖励信号,从而在无需访问真实环境奖励的情况下实现奖励塑形。
  • 该方法采用离策略演员-critic框架,高效地利用专家示范与自生成经验训练策略,并通过重要性采样校正分布偏移。
  • SAIL 实现了一种动态示范替换机制,基于稀疏奖励选择并替换表现较差的示范为更高回报的自生成轨迹。
  • 该算法通过在当前教师分布的模仿与探索以发现更优策略之间交替进行,迭代改进目标策略。
  • 它利用归一化的平稳状态-动作分布 $ d_{\pi} $ 定义策略目标,并使用一种自然优先考虑专家示范的塑形奖励函数,尤其在训练初期。

实验结果

研究问题

  • RQ1当仅能获得次优专家示范时,模仿学习方法是否能实现接近最优的性能?
  • RQ2在缺乏密集奖励信号的情况下,如何在稀疏奖励环境中有效引导探索?
  • RQ3模仿示范行为与探索新型、更高回报轨迹之间的最优权衡是什么?
  • RQ4通过用更优的自生成轨迹动态自适应地替换示范,是否能实现超越教师策略的性能?
  • RQ5如何在保持对低质量示范鲁棒性的同时,使离策略模仿学习更具样本效率?

主要发现

  • SAIL 在稀疏奖励的连续控制任务中,相比最先进方法,显著提升了样本效率。
  • 即使仅提供有限数量的次优示范,该方法仍能实现接近最优的性能,并超越教师策略的性能。
  • 在多个基准环境的最终渐近回报方面,SAIL 在模仿学习与强化学习基线方法中表现更优。
  • 通过将示范动态替换为高回报的自生成轨迹,性能随时间持续提升。
  • 基于判别器的合成奖励的使用,使探索更加有效,且无需访问真实环境奖励。
  • 实验结果表明,SAIL 保持了稳定的训练过程,避免了因次优示范导致的性能下降,而标准 IL 方法则存在此类问题。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。