Skip to main content
QUICK REVIEW

[论文解读] Adversarial Imitation via Variational Inverse Reinforcement Learning

Ahmed H. Qureshi, Byron Boots|arXiv (Cornell University)|Sep 17, 2018
Reinforcement Learning in Robotics参考文献 24被引用 6
一句话总结

该论文提出EAIRL,一种新型对抗性逆强化学习方法,通过变分信息最大化正则化策略更新中的赋能(empowerment),联合学习近似最优的状态-动作奖励函数与策略。该方法在模仿学习和迁移学习中均优于当前最先进(SOTA)的IRL方法,恢复出鲁棒、解耦且可迁移的奖励函数,即使在动态或结构域移位下也能实现专家级行为。

ABSTRACT

We consider a problem of learning the reward and policy from expert examples under unknown dynamics. Our proposed method builds on the framework of generative adversarial networks and introduces the empowerment-regularized maximum-entropy inverse reinforcement learning to learn near-optimal rewards and policies. Empowerment-based regularization prevents the policy from overfitting to expert demonstrations, which advantageously leads to more generalized behaviors that result in learning near-optimal rewards. Our method simultaneously learns empowerment through variational information maximization along with the reward and policy under the adversarial learning formulation. We evaluate our approach on various high-dimensional complex control tasks. We also test our learned rewards in challenging transfer learning problems where training and testing environments are made to be different from each other in terms of dynamics or structure. The results show that our proposed method not only learns near-optimal rewards and policies that are matching expert behavior but also performs significantly better than state-of-the-art inverse reinforcement learning algorithms.

研究动机与目标

  • 为解决现有逆强化学习(IRL)方法在恢复可迁移、解耦且与动作相关的奖励函数方面的局限性。
  • 通过引入赋能作为策略学习的正则化项,克服对抗性模仿学习中的过拟合与局部收敛问题。
  • 实现近似最优、基于状态-动作的奖励函数的恢复,这对于运动控制与操作等实际控制任务至关重要。
  • 提升所学策略与奖励在动力学或结构不同的环境之间迁移时的泛化能力与可迁移性。
  • 开发一个统一框架,通过对抗性训练与变分信息最大化,同时学习奖励、策略与赋能。

提出的方法

  • 采用生成对抗性模仿学习(GAIL)框架,训练判别器以区分专家轨迹与生成轨迹。
  • 在策略更新中引入赋能正则化,鼓励智能体最大化其影响未来状态的能力,从而防止对专家示范的过拟合。
  • 使用变分信息最大化(VIM)以端到端可微的方式联合学习赋能、奖励与策略。
  • 将奖励函数建模为状态与动作(s,a)的函数,实现对具有扭矩惩罚等控制任务至关重要的动作依赖型奖励塑造。
  • 应用最大熵逆强化学习(MaxEnt-IRL)原则,确保策略行为的随机性与多样性。
  • 利用重要性采样与KL散度最小化,使策略生成的轨迹分布与专家示范对齐。

实验结果

研究问题

  • RQ1赋能正则化是否能提升在对抗性模仿学习中从专家示范学习到的策略的泛化能力与鲁棒性?
  • RQ2将奖励函数建模为状态与动作(s,a)的联合函数,是否能相比仅依赖状态的设定,更好地恢复真实奖励结构中的动作依赖项?
  • RQ3所提出方法能否学习到可迁移、解耦且近似最优的奖励函数,使其在具有不同动力学或结构的环境中具有泛化能力?
  • RQ4EAIRL与当前最先进IRL方法(如GAIL与AIRL)相比,在策略性能与奖励恢复质量方面表现如何?
  • RQ5赋能正则化在多大程度上能防止策略训练过程中的过早收敛至局部行为?

主要发现

  • 在HalfCheetah环境中,EAIRL的平均回报达到1870.10 ± 17.86,优于GAIL(1880.05 ± 15.72)与AIRL(s,a)(1826.26 ± 19.64),且方差更低。
  • 在Ant环境中,EAIRL获得641.12 ± 25.92的回报,显著优于AIRL(s)(271.31 ± 9.35)与GCL(-189.90 ± 44.42),展现出更优的策略学习能力。
  • EAIRL成功恢复了真实奖励函数中的动作依赖惩罚项,而AIRL(s)未能学习此类项,导致行为激进且不稳定。
  • 在迁移学习中,EAIRL所学奖励能泛化至具有不同动力学或结构的环境,实现专家级性能,而其他方法则失败。
  • 实证结果表明,仅依赖状态的奖励设定(如AIRL(s))会导致策略行为欠佳,例如在运动控制任务中翻倒,原因在于缺少动作正则化。
  • 赋能正则化与状态-动作奖励建模的结合,使得在多样化控制任务中均能恢复近似最优策略与鲁棒、可迁移的奖励函数。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。