Skip to main content
QUICK REVIEW

[论文解读] Intrinsic Reward Driven Imitation Learning via Generative Model

Xingrui Yu, Yueming Lyu|arXiv (Cornell University)|Jun 26, 2020
Reinforcement Learning in Robotics被引用 12
一句话总结

本文提出了一种新型方法——生成式内在奖励驱动模仿学习(GIRIL),该方法利用条件变分自编码器(VAE)从单次生命示范中学习内在奖励,在Atari游戏中实现自我监督探索,使智能体性能超越专家水平,最高可达到示范者的5倍奖励。

ABSTRACT

Imitation learning in a high-dimensional environment is challenging. Most inverse reinforcement learning (IRL) methods fail to outperform the demonstrator in such a high-dimensional environment, e.g., Atari domain. To address this challenge, we propose a novel reward learning module to generate intrinsic reward signals via a generative model. Our generative method can perform better forward state transition and backward action encoding, which improves the module's dynamics modeling ability in the environment. Thus, our module provides the imitation agent both the intrinsic intention of the demonstrator and a better exploration ability, which is critical for the agent to outperform the demonstrator. Empirical results show that our method outperforms state-of-the-art IRL methods on multiple Atari games, even with one-life demonstration. Remarkably, our method achieves performance that is up to 5 times the performance of the demonstration.

研究动机与目标

  • 解决在仅提供一次生命示范的情况下,如何在高维环境(如Atari)中实现专家级甚至超越专家级性能的挑战。
  • 克服传统逆向强化学习(IRL)和行为克隆(BC)方法因数据稀缺和奖励偏差而导致的性能不足问题。
  • 通过生成模型生成一组内在奖励,在低数据场景下实现有效的探索与策略优化。
  • 通过联合学习前向状态转移与后向动作编码,提升动力学建模能力。
  • 在最小示范数据条件下,相较于最先进IRL与基于好奇心的方法,实现更优的模仿性能。

提出的方法

  • 提出基于条件VAE的生成式内在奖励学习(GIRL)模块,将前向动力学建模为条件解码器,后向动作编码建模为条件编码器。
  • 利用VAE从当前状态和动作生成多样化未来状态,并从未来状态重建动作,从而提升动力学建模精度。
  • 基于重构误差与转移概率生成一组内在奖励,支持基于采样的自我监督探索。
  • 使用近端策略优化(PPO)在内在奖励函数上训练策略,以最大化累积回报。
  • 在使用式(6)中的重构损失计算奖励前,将状态与预测状态归一化至[-1, 1]。
  • 以3e-4的学习率优化奖励学习模块,并采用标准PPO超参数,包括γ=0.95的GAE与0.0的熵系数。

实验结果

研究问题

  • RQ1生成模型能否从单次生命示范中学习到内在奖励信号,使模仿智能体在高维环境中超越示范者?
  • RQ2联合建模前向状态转移与后向动作编码是否能提升动力学建模能力,从而实现更优的探索与策略学习?
  • RQ3在模仿性能与样本效率方面,所提出的GIRIL方法相较于最先进IRL与基于好奇心的方法表现如何?
  • RQ4通过VAE生成的内在奖励是否能支持自我监督探索,从而在Atari游戏中实现超人类表现?
  • RQ5通过条件VAE进行动力学建模的质量,在低数据模仿学习设置下对最终策略性能的影响程度如何?

主要发现

  • GIRIL在连续控制任务与Atari游戏上均优于最先进IRL方法(包括GAIL与VAIL),在所有评估设置中均达到最高平均回报。
  • 在InvertedPendulum与InvertedDoublePendulum任务中,GIRIL分别获得990.2与9,164.9的平均回报,优于CDIL(979.7与7,114.7)与GAIL(113.6与725.2)。
  • 在Atari游戏中,GIRIL即使仅基于单次生命示范训练,仍可将奖励提升至专家水平的5倍。
  • 随着完整轨迹示范数量的增加,GIRIL在所有评估游戏与任务中持续保持最高性能。
  • 消融实验表明,联合建模前向动力学与后向动作编码相比基线方法显著提升性能。
  • 该方法展现出鲁棒性与可扩展性,在多个随机种子与多样化环境中均保持优越性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。