Skip to main content
QUICK REVIEW

[论文解读] Augmenting GAIL with BC for sample efficient imitation learning

Rohit Jena, Changliu Liu|arXiv (Cornell University)|Jan 21, 2020
Reinforcement Learning in Robotics参考文献 32被引用 7
一句话总结

该论文提出了一种简单且稳定的混合方法,结合行为克隆(BC)与生成对抗模仿学习(GAIL),实现样本高效的模仿学习。通过整合BC的快速收敛特性与GAIL的分布匹配能力,该方法在保持低维与高维控制任务最优性能的同时,相较于GAIL将环境交互次数减少了整整一个数量级。

ABSTRACT

Imitation learning is the problem of recovering an expert policy without access to a reward signal. Behavior cloning and GAIL are two widely used methods for performing imitation learning. Behavior cloning converges in a few iterations but doesn't achieve peak performance due to its inherent iid assumption about the state-action distribution. GAIL addresses the issue by accounting for the temporal dependencies when performing a state distribution matching between the agent and the expert. Although GAIL is sample efficient in the number of expert trajectories required, it is still not very sample efficient in terms of the environment interactions needed for convergence of the policy. Given the complementary benefits of both methods, we present a simple and elegant method to combine both methods to enable stable and sample efficient learning. Our algorithm is very simple to implement and integrates with different policy gradient algorithms. We demonstrate the effectiveness of the algorithm in low dimensional control tasks, gridworlds and in high dimensional image-based tasks.

研究动机与目标

  • 解决GAIL在环境交互次数上的样本效率低下问题,尽管其对专家轨迹的样本需求较低。
  • 克服由于对状态-动作分布采用独立同分布假设而导致的行为克隆的误差累积与泛化能力差的问题。
  • 开发一种统一的在线策略模仿学习框架,结合BC与GAIL的优势,且无需依赖预训练。
  • 在低维控制与高维图像基环境中提升训练稳定性与收敛速度。
  • 证明在GAIL目标函数中引入BC作为正则化项,其性能优于标准的预训练策略。

提出的方法

  • 该方法引入一种混合损失函数,将行为克隆损失与GAIL的对抗奖励信号相结合。
  • 使用策略梯度算法进行策略训练,目标函数为联合优化:通过监督式BC损失实现即时性能,通过GAIL的判别器奖励信号实现长期分布匹配。
  • 系数α控制BC与GAIL组件之间的权衡,其中α=1对应纯BC,α=0对应纯GAIL。
  • 该方法兼容多种策略梯度算法,且可通过最小修改扩展至离策略设置。
  • GAIL中的判别器被训练以区分专家的状态-动作对与智能体生成的状态-动作对,从而为策略优化提供奖励信号。
  • 该方法避免使用离策略回放缓冲区与持久数据存储,适用于安全关键或隐私敏感的应用场景。

实验结果

研究问题

  • RQ1将行为克隆与GAIL结合是否能在不牺牲渐近性能的前提下提升环境交互的样本效率?
  • RQ2为何在使用BC进行预训练后,使用GAIL进行微调会失败,尽管BC本身收敛迅速?
  • RQ3在GAIL目标函数中引入BC作为正则化项,是否能带来比纯GAIL或BC预训练更快、更稳定的训练?
  • RQ4在GAIL已知不稳定的高维图像基环境中,该方法表现如何?
  • RQ5该方法是否能在包括低维控制、网格世界与连续控制任务在内的多样化环境中保持性能优势?

主要发现

  • 在网格世界环境中,所提方法在所有网格尺寸(8×8、10×10、12×12)下均优于GAIL与行为克隆,且样本效率持续提升。
  • 在12×12网格中,仅使用稀疏奖励的REINFORCE在3000万步后仅达到GAIL性能的约70%,而所提方法更快地达到或超越了GAIL的性能。
  • 在Car Racing环境中,所提方法的平均得分为732.55 ± 45.73,优于GAIL(419.82 ± 198.61)与BC+GAIL(594.86 ± 263.12),并接近专家得分740.42 ± 86.36。
  • 在基于图像的任务中,该方法相较GAIL将环境交互次数减少了整整一个数量级,仅用更少的rollout次数即达到接近专家的性能。
  • 使用BC预训练后进行GAIL微调完全失败,性能坍塌至零,表明当使用专家演示初始化时,无法通过GAIL有效微调BC策略。
  • 该方法在多种策略梯度算法与环境(包括MuJoCo、网格世界与图像基控制任务)中均表现出稳定性与持续的性能提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。