Skip to main content
QUICK REVIEW

[论文解读] Random Expert Distillation: Imitation Learning via Expert Policy Support Estimation

Ruohan Wang, Carlo Ciliberto|arXiv (Cornell University)|May 16, 2019
Explainable Artificial Intelligence (XAI)参考文献 27被引用 17
一句话总结

本文提出了一种名为随机专家蒸馏(RED)的新颖模仿学习框架,通过估计专家策略的支持集来生成固定且内在的奖励函数,从而在无需动态更新奖励的情况下实现稳定的模仿学习。通过借鉴随机网络蒸馏和自编码器的思想,RED在离散与连续控制任务(包括自动驾驶)中的表现与或优于当前最先进方法(如GAIL和GMMIL)。

ABSTRACT

We consider the problem of imitation learning from a finite set of expert trajectories, without access to reinforcement signals. The classical approach of extracting the expert's reward function via inverse reinforcement learning, followed by reinforcement learning is indirect and may be computationally expensive. Recent generative adversarial methods based on matching the policy distribution between the expert and the agent could be unstable during training. We propose a new framework for imitation learning by estimating the support of the expert policy to compute a fixed reward function, which allows us to re-frame imitation learning within the standard reinforcement learning setting. We demonstrate the efficacy of our reward function on both discrete and continuous domains, achieving comparable or better performance than the state of the art under different reinforcement learning algorithms.

研究动机与目标

  • 解决GAIL和GMMIL等对抗式模仿学习方法存在的不稳定性和计算成本过高的问题。
  • 通过从专家轨迹中学习鲁棒奖励函数,克服行为克隆中的误差累积问题。
  • 开发一种估计专家策略支持集的方法,以定义固定奖励函数,避免迭代式奖励更新。
  • 实现在训练过程中无需访问强化信号或专家策略的情况下,仅从有限组专家演示中实现有效的模仿学习。
  • 提升模仿学习中的样本效率与泛化能力,特别是在自动驾驶等高维控制任务中。

提出的方法

  • RED采用受随机网络蒸馏启发的方法来估计专家策略的支持集,其中随机编码器将状态映射到潜在表征。
  • 训练一个自编码器以在潜在空间中重建专家状态,从而学习专家支持集的紧凑表征。
  • 利用潜在空间中的重建误差作为固定内在奖励函数,对专家支持集之外的状态赋予低奖励。
  • 将该奖励函数集成至标准强化学习框架中,实现无需动态奖励调整的稳定训练。
  • 该方法基于如下思想:位于专家支持集之外的状态具有‘新颖性’,因此通过高重建误差被惩罚。
  • 该方法与GAIL正交,可与之结合以提升探索能力与鲁棒性。

实验结果

研究问题

  • RQ1专家策略支持估计能否提供一种稳定且有效的对抗式模仿学习替代方案?
  • RQ2基于支持估计生成的固定奖励函数能否在模仿学习中超越动态奖励函数?
  • RQ3基于支持的奖励塑造在样本效率与泛化能力方面,相较于行为克隆与逆向强化学习有何表现?
  • RQ4RED在复杂环境(如自动驾驶)中,从有限专家演示中泛化的程度如何?
  • RQ5RED与GAIL的结合能否提升模仿学习中的探索能力与训练稳定性?

主要发现

  • 在自动驾驶任务中,RED实现了4825的平均回合奖励,显著优于GAIL(795)、GMMIL(2024)、BC(1033)和AE(4378)。
  • 在HalfCheetah与Ant环境中,RED需通过行为克隆进行策略初始化才能获得良好性能,而GAIL与GMMIL则能从随机初始化中成功训练。
  • RED对随机初始化表现出鲁棒性,其标准差低于AE(1552 vs. 1726),表明训练过程更稳定。
  • RED的奖励函数能正确惩罚危险状态(如碰撞与近碰撞),对这些状态赋予接近零的奖励。
  • GAIL表现出过拟合问题,判别器更新后常无法避免障碍物;而GMMIL则产生不一致的激励,甚至在碰撞前赋予正向奖励。
  • RED的奖励函数能有效识别与专家演示差异较大的状态,与现实世界中安全关键行为保持一致。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。