Skip to main content
QUICK REVIEW

[论文解读] Inverse reinforcement learning for video games

Aaron David Tucker, Adam Gleave|arXiv (Cornell University)|Oct 24, 2018
Reinforcement Learning in Robotics参考文献 22被引用 22
一句话总结

本论文提出了一种新颖的对抗性逆强化学习(IRL)框架,用于高维视频游戏,采用基于卷积神经网络(CNN)的生成器和判别器,结合奖励归一化与一种新型像素感知自编码器,以学习低维状态表征。该方法在Catcher游戏中实现了接近专家水平的性能,并在Enduro游戏中获得了得分,表明通过适当的架构与训练改进,基于GAN的IRL可被稳定化并扩展至类似Atari的环境。

ABSTRACT

Deep reinforcement learning achieves superhuman performance in a range of video game environments, but requires that a designer manually specify a reward function. It is often easier to provide demonstrations of a target behavior than to design a reward function describing that behavior. Inverse reinforcement learning (IRL) algorithms can infer a reward from demonstrations in low-dimensional continuous control environments, but there has been little work on applying IRL to high-dimensional video games. In our CNN-AIRL baseline, we modify the state-of-the-art adversarial IRL (AIRL) algorithm to use CNNs for the generator and discriminator. To stabilize training, we normalize the reward and increase the size of the discriminator training dataset. We additionally learn a low-dimensional state representation using a novel autoencoder architecture tuned for video game environments. This embedding is used as input to the reward network, improving the sample efficiency of expert demonstrations. Our method achieves high-level performance on the simple Catcher video game, substantially outperforming the CNN-AIRL baseline. We also score points on the Enduro Atari racing game, but do not match expert performance, highlighting the need for further work.

研究动机与目标

  • 弥合深度强化学习在已知奖励上的优化能力与在高维视频游戏中无法从专家示范中学习奖励之间的差距。
  • 解决对抗性IRL在Atari游戏典型高维、不连续状态空间中的训练不稳定性问题。
  • 通过从原始画面中学习低维、有意义的状态表征,提升专家示范的样本效率。
  • 通过奖励归一化与对过去生成器版本的多轮判别器训练,实现训练稳定化。
  • 通过克服多模态示范与稀疏奖励等挑战,使IRL在视频游戏中实现人类水平性能。

提出的方法

  • 将对抗性IRL(AIRL)适配为在生成器(策略)与判别器(奖励网络)中均使用卷积神经网络(CNN),以处理高维图像输入。
  • 引入奖励归一化以防止训练过程中的奖励漂移,提升长时序游戏中的训练稳定性。
  • 通过在多个过去生成器迭代版本的状态-动作对上训练判别器,增强其泛化能力,降低方差与过拟合。
  • 设计了一种新型像素类别自编码器,优先确保视频游戏中小而动态物体(如球体)的精确重建,从而提升状态表征质量。
  • 将学习到的低维嵌入作为奖励网络的输入,同时保持策略网络的输入为原始帧,从而提升样本效率。
  • 使用近端策略优化(PPO)训练生成器,奖励函数通过对抗性训练迭代更新,以匹配专家行为。

实验结果

研究问题

  • RQ1对抗性逆强化学习能否在类似Atari的高维视频游戏环境中实现稳定化与可扩展性?
  • RQ2使用专用自编码器学习的低维状态表征,对视频游戏IRL的样本效率与性能有何影响?
  • RQ3多轮次判别器训练在高维IRL中在多大程度上可减少过拟合并提升策略性能?
  • RQ4奖励归一化能否防止长时序视频游戏IRL中的奖励漂移并提升训练稳定性?
  • RQ5为何标准自编码器无法有效表征关键游戏元素(如移动的球体),以及在IRL中如何解决此问题?

主要发现

  • 所提方法在Catcher游戏中实现了接近专家水平的性能,显著优于CNN-AIRL基线模型。
  • 该方法在Atari竞速游戏Enduro中成功获得得分,证明了在复杂视频游戏中应用IRL的可行性,尽管性能仍低于专家水平。
  • 使用像素类别自编码器后,即使在小样本数据集下,判别器的误报率也显著降低,且对移动游戏物体的重建更清晰,优于标准自编码器。
  • 奖励归一化与多轮次判别器训练在高维环境中对训练稳定化与防止奖励漂移至关重要。
  • 自编码器学习到的低维状态嵌入显著提升了样本效率,使在更少专家示范下也能获得更好性能。
  • 尽管有所改进,Enduro游戏中的性能仍远低于专家水平,表明在将IRL扩展至复杂Atari游戏方面仍存在重大挑战。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。