Skip to main content
QUICK REVIEW

[论文解读] Sample-Efficient Imitation Learning via Generative Adversarial Nets

Lionel Blondé, Alexandros Kalousis|arXiv (Cornell University)|Sep 6, 2018
Reinforcement Learning in Robotics参考文献 53被引用 21
一句话总结

本文提出SAM(Sample-efficient Adversarial Imitation Learning),一种无需模型的模仿学习方法,通过结合离策略演员-critic学习与对抗性训练的替代奖励函数,其样本效率显著高于GAIL。通过在离策略更新中重用过往经验,并利用确定性策略梯度,SAM将环境交互次数减少了两个数量级,同时在连续控制任务中保持了稳定且达到专家水平的性能。

ABSTRACT

GAIL is a recent successful imitation learning architecture that exploits the adversarial training procedure introduced in GANs. Albeit successful at generating behaviours similar to those demonstrated to the agent, GAIL suffers from a high sample complexity in the number of interactions it has to carry out in the environment in order to achieve satisfactory performance. We dramatically shrink the amount of interactions with the environment necessary to learn well-behaved imitation policies, by up to several orders of magnitude. Our framework, operating in the model-free regime, exhibits a significant increase in sample-efficiency over previous methods by simultaneously a) learning a self-tuned adversarially-trained surrogate reward and b) leveraging an off-policy actor-critic architecture. We show that our approach is simple to implement and that the learned agents remain remarkably stable, as shown in our experiments that span a variety of continuous control tasks. Video visualisations available at: \url{https://youtu.be/-nCsqUJnRKU}.

研究动机与目标

  • 为解决GAIL存在的高样本复杂度问题,其收敛需要过多的环境交互。
  • 在不依赖专家演示数量的前提下,提升模仿学习的样本效率。
  • 通过结合离策略学习与基于梯度的策略优化,稳定对抗性模仿学习。
  • 实现在环境交互成本高或存在危险的现实场景中更快部署。
  • 证明离策略演员-critic方法可与基于GAN的奖励学习在无模型框架中有效结合。

提出的方法

  • SAM采用离策略演员-critic架构,重用经验回放缓冲区中的历史转移数据,减少对新环境交互的依赖。
  • 采用生成对抗网络(GAN)框架,其中判别器用于区分专家演示与由专家生成的轨迹。
  • 策略通过确定性策略梯度(DPG)更新进行训练,实现通过奖励函数梯度信息进行反向传播。
  • 通过对抗方式学习自适应的替代奖励,使策略能够基于奖励信号的梯度进行优化。
  • 在策略和评论家网络中应用层归一化与Pop-Art,以稳定训练并处理奖励尺度的变化。
  • 采用与GAIL相同的共享判别器架构,确保公平比较,并通过多个并行训练实例实现垂直可扩展性。

实验结果

研究问题

  • RQ1离策略学习是否能显著减少模仿学习所需的环境交互次数?
  • RQ2将对抗性奖励学习与离策略演员-critic训练相结合,是否能在不牺牲策略稳定性的情况下提升样本效率?
  • RQ3在无模型模仿学习框架中,能否有效利用奖励函数的梯度信息?
  • RQ4在多种连续控制任务中,该方法与GAIL相比在渐近性能和收敛速度方面表现如何?
  • RQ5在模仿学习中,过去的经验在多大程度上可被重用,以减少对新环境交互的需求?

主要发现

  • 与GAIL相比,SAM将达到专家水平性能所需的环境交互次数减少了两个数量级。
  • 在Reacher和InverseDoublePendulum等环境中,SAM在渐近性能上始终与GAIL持平或更优,而GAIL在某些情况下甚至无法达到专家的回报水平。
  • 尽管结合了对抗学习与离策略更新,该方法仍能实现稳定训练,而这两者通常易导致不稳定。
  • SAM通过时序差分学习,仅需每次更新使用少量转移数据即可实现高效的策略评估,而GAIL采用需要完整轨迹的蒙特卡洛方法。
  • 即使在演示数据有限的情况下,该方法仍能保持高性能,展现出对不同数据集规模的鲁棒性。
  • 由于使用了经验回放,壁钟时间训练更长,但在环境交互成本高昂的实际应用中,这种权衡是合理的。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。