Skip to main content
QUICK REVIEW

[論文レビュー] Inverse reinforcement learning for video games

Aaron David Tucker, Adam Gleave|arXiv (Cornell University)|Oct 24, 2018
Reinforcement Learning in Robotics参考文献 22被引用数 22
ひとこと要約

本論文は、CNNベースの生成器および識別器に加え、報酬正規化と新しいピクセルに配慮した自己符号化器を用いた、高次元のビデオゲーム向けの新規な敵対的逆強化学習(IRL)フレームワークを提案する。この手法は、Catcherゲームで準専門家水準の性能を達成し、Enduroでも得点を獲得した。これは、GANベースのIRLが適切なアーキテクチャ的・訓練的変更を施すことにより、Atariに類似した環境へ安定化・スケーリング可能であることを示している。

ABSTRACT

Deep reinforcement learning achieves superhuman performance in a range of video game environments, but requires that a designer manually specify a reward function. It is often easier to provide demonstrations of a target behavior than to design a reward function describing that behavior. Inverse reinforcement learning (IRL) algorithms can infer a reward from demonstrations in low-dimensional continuous control environments, but there has been little work on applying IRL to high-dimensional video games. In our CNN-AIRL baseline, we modify the state-of-the-art adversarial IRL (AIRL) algorithm to use CNNs for the generator and discriminator. To stabilize training, we normalize the reward and increase the size of the discriminator training dataset. We additionally learn a low-dimensional state representation using a novel autoencoder architecture tuned for video game environments. This embedding is used as input to the reward network, improving the sample efficiency of expert demonstrations. Our method achieves high-level performance on the simple Catcher video game, substantially outperforming the CNN-AIRL baseline. We also score points on the Enduro Atari racing game, but do not match expert performance, highlighting the need for further work.

研究の動機と目的

  • 高次元のビデオゲームにおける、既知の報酬を最適化できる深層強化学習と、専門家の示す行動から報酬を学習できないという深層強化学習のギャップを埋めること。
  • Atariゲームに特徴的な高次元的かつ不連続な状態空間において、敵対的IRLの不安定性に対処すること。
  • 生フレームから低次元的で意味のある状態表現を学習することで、専門家デモンストレーションのサンプル効率を向上させること。
  • 報酬正規化と過去の生成器バージョンを複数回にわたって識別器に訓練することで、訓練を安定化させること。
  • マルチモーダルなデモンストレーションや疎い報酬といった課題を克服することで、IRLがビデオゲームで人間水準の性能を達成できるようにすること。

提案手法

  • 生成器(方策)および識別器(報酬ネットワーク)の両方で畳み込みニューラルネットワーク(CNN)を用いることで、高次元の画像入力を処理可能な、適応化された敵対的IRL(AIRL)を実装。
  • 報酬のドリフトを防ぐために報酬正規化を導入し、長時間のタスクにおける訓練安定性を向上。
  • 複数の過去の生成器イテレーションからの状態-行動ペアを用いて識別器を訓練することで、一般化性能を向上させ、分散と過学習を低減。
  • 動的で小さなオブジェクト(例:ボール)の再構成を優先する新しいピクセルクラス自己符号化器を設計し、状態表現の質を向上。
  • 学習された低次元埋め込みを報酬ネットワークの入力として使用しながら、方策ネットワークの入力は生フレームのままにすることで、サンプル効率を向上。
  • 生成器をPPO(近接方策最適化)で訓練し、報酬関数を敵対的訓練により反復的に更新することで、専門家行動を再現。

実験結果

リサーチクエスチョン

  • RQ1敵対的逆強化学習は、Atariに類似した高次元のビデオゲーム環境へ安定化・スケーリング可能か?
  • RQ2特化した自己符号化器から得られる低次元状態表現を用いることで、IRLにおけるサンプル効率と性能にどのような影響を与えるか?
  • RQ3複数イテレーションにわたる識別器訓練は、高次元IRLにおける過学習をどれほど低減し、方策性能を向上させるか?
  • RQ4報酬正規化は、長時間のタスクにおけるビデオゲームIRLで報酬ドリフトを防ぎ、訓練安定性を向上させるか?
  • RQ5標準的な自己符号化器がなぜ重要なゲーム要素(例:移動中のボール)を正しく表現できないのか、そしてIRLにおいてこの問題をどのように解決できるか?

主な発見

  • 提案手法はCatcherゲームで準専門家水準の性能を達成し、CNN-AIRLベースラインを著しく上回った。
  • 本手法はEnduroというAtariレーシングゲームでも得点を獲得した。これは、複雑なビデオゲームにおけるIRLの実現可能性を示しているが、専門家レベルには達しなかった。
  • ピクセルクラス自己符号化器を用いることで、データセットが小さい場合でも識別器の偽陽性率が低下し、標準的な自己符号化器よりも動的ゲームオブジェクトの再構成が鮮明になった。
  • 報酬正規化と複数イテレーションにわたる識別器訓練は、高次元環境における訓練の安定化と報酬ドリフトの防止に不可欠であった。
  • 自己符号化器から得られる低次元状態埋め込みは、サンプル効率を著しく向上させ、少ない専門家デモンストレーションでもより良い性能を達成可能にした。
  • 改善は見られたが、Enduroにおける性能は依然として専門家レベルに大きく及ばず、IRLを複雑なAtariゲームへスケーリングする上でさらなる課題が残っている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。