Skip to main content
QUICK REVIEW

[论文解读] A Pragmatic Look at Deep Imitation Learning

Kai Arulkumaran, Dan Ogawa Lillrank|arXiv (Cornell University)|Aug 4, 2021
Reinforcement Learning in Robotics参考文献 45被引用 4
一句话总结

本文使用基于SAC的统一离策略框架和D4RL MuJoCo基准,对六种深度模仿学习算法——GAIL、AdRIL、BC以及更新后的GMMIL、DRIL和RED的离策略变体——进行了公平、实证的比较。在不同轨迹预算下,GAIL表现始终最佳;AdRIL在简化调参条件下也表现出色;而行为克隆(BC)在数据充足时仍具有极强竞争力。

ABSTRACT

The introduction of the generative adversarial imitation learning (GAIL) algorithm has spurred the development of scalable imitation learning approaches using deep neural networks. Many of the algorithms that followed used a similar procedure, combining on-policy actor-critic algorithms with inverse reinforcement learning. More recently there have been an even larger breadth of approaches, most of which use off-policy algorithms. However, with the breadth of algorithms, everything from datasets to base reinforcement learning algorithms to evaluation settings can vary, making it difficult to fairly compare them. In this work we re-implement 6 different IL algorithms, updating 3 of them to be off-policy, base them on a common off-policy algorithm (SAC), and evaluate them on a widely-used expert trajectory dataset (D4RL) for the most common benchmark (MuJoCo). After giving all algorithms the same hyperparameter optimisation budget, we compare their results for a range of expert trajectories. In summary, GAIL, with all of its improvements, consistently performs well across a range of sample sizes, AdRIL is a simple contender that performs well with one important hyperparameter to tune, and behavioural cloning remains a strong baseline when data is more plentiful.

研究动机与目标

  • 为解决深度模仿学习中因评估协议、数据集和算法选择不一致而导致的缺乏公平、可复现比较的问题。
  • 重新实现并更新六种IL算法(包括GAIL、AdRIL等),使其基于离策略强化学习(SAC)进行一致的训练与评估。
  • 在相同超参数优化预算和同一专家轨迹数据集(D4RL)下,于多个MuJoCo环境中评估所有方法。
  • 识别在真实数据约束和实现差异下仍具鲁棒性和实用性的IL方法。
  • 发布统一的开源代码库,以支持未来模仿学习研究中的公平基准测试和可复现性。

提出的方法

  • 基于软演员-critic(SAC)作为统一的离策略强化学习基线算法,重新实现六种深度IL算法:GAIL、GMMIL、RED、DRIL、AdRIL和PWIL。
  • 将三种原为在线策略的IL方法(GMMIL、RED、DRIL)更新为离策略设置,以实现与SAC基线的一致比较。
  • 采用MuJoCo环境中专家轨迹的D4RL数据集作为标准评估基准。
  • 为所有算法应用统一的超参数优化预算,确保公平比较,每种方法使用50次试验的贝叶斯优化。
  • 采用当前最佳实践报告结果:使用多个随机种子、报告均值与标准差,并进行统计显著性评估。
  • 通过监控奖励趋势和Q值,诊断离策略DRIL、GMMIL和RED的训练失败问题,并探索在线判别器训练的变体。

实验结果

研究问题

  • RQ1当使用统一的离策略RL主干(SAC)和同一专家数据集时,不同深度模仿学习算法在相同训练条件下表现如何?
  • RQ2将在线策略IL算法转换为离策略设置后,其性能是否下降?若是,原因是什么?
  • RQ3不同IL方法的超参数选择(如批量大小、判别器更新频率)如何随轨迹预算规模变化?
  • RQ4在专家数据有限的情况下,更简单的IL方法(如AdRIL)能否与更复杂的算法(如GAIL)表现相当甚至更优?
  • RQ5当专家数据充足时,行为克隆(BC)作为基线发挥何种作用?其性能如何随数据量变化?

主要发现

  • GAIL在所有轨迹预算下均表现最佳,在HalfCheetah环境中使用25条轨迹时,平均回报为11,392.09 ± 377.15。
  • AdRIL在较高轨迹预算(25条)下表现接近GAIL,获得5,055.76 ± 64.13的回报,且仅需调优一个关键超参数:判别器更新频率。
  • 当提供25条专家轨迹时,行为克隆(BC)成为强有力的基线,其性能超过多个对抗性IL方法。
  • 尽管经过大量超参数调优和正则化,DRIL、GMMIL和RED的离策略版本仍无法收敛,表明从在线策略到离策略训练存在根本性不兼容。
  • 超参数调优显示,批量大小和判别器规模通常随轨迹预算增加而增大,但该趋势并不一致(例如,GAIL的最优批量大小随数据增多而减小)。
  • 原始在线策略版本的DRIL、GMMIL和RED均可成功优化,表明失败原因特异地源于离策略适配过程,而非算法本身。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。