Skip to main content
QUICK REVIEW

[論文レビュー] Expert-augmented actor-critic for ViZDoom and Montezumas Revenge

Michal Garmulewicz, Henryk Michalewski|arXiv (Cornell University)|Sep 10, 2018
Reinforcement Learning in Robotics参考文献 25被引用数 6
ひとこと要約

この論文では、エキスパートの行動データを用いた教師あり学習をACKTRと組み合わせることで、スパarsity reward環境における探索を改善するエキスパート拡張型アクタ・クリティック手法を提案する。本手法は、モンテズマのレヴェン(Montezuma’s Revenge)でSOTA(最先端)の性能を達成し、一貫して27,000点以上を記録し、一部の実行ではエキスパートデータを上回った。また、カリキュラム学習を用いずにViZDoomのMyWayHome迷路でも効率的な学習を可能にした。

ABSTRACT

We propose an expert-augmented actor-critic algorithm, which we evaluate on two environments with sparse rewards: Montezumas Revenge and a demanding maze from the ViZDoom suite. In the case of Montezumas Revenge, an agent trained with our method achieves very good results consistently scoring above 27,000 points (in many experiments beating the first world). With an appropriate choice of hyperparameters, our algorithm surpasses the performance of the expert data. In a number of experiments, we have observed an unreported bug in Montezumas Revenge which allowed the agent to score more than 800,000 points.

研究の動機と目的

  • 強化学習におけるスパarsity報酬の課題に対処すること。特に、ランダムな探索では非効率的でサンプル非効率となる状況を想定する。
  • モンテズマのレヴェンやViZDoomのMyWayHomeのような環境において、スパarsity報酬が学習を妨げる状況での、サンプル効率と探索の向上を図ること。
  • 反復的なエキスパートとのやり取りを必要とせず、モデルフリーのアクタ・クリティックフレームワークにエキスパートのデモンストレーションを統合する実用的な手法の開発。
  • 高レベルの計画を要するスパarsity報酬環境において、エキスパート拡張学習がエキスパートの性能を上回ることを評価すること。

提案手法

  • 本手法は、事前に記録されたエキスパートの行動データに基づく教師あり学習による1つのエキスパート模倣損失項とACKTRアルゴリズムを組み合わせる。
  • 主な革新点は、エキスパートデータをポリシー勾配更新に統合する1つの式(式1)の使用であり、誤差の累積を防ぎながら探索を誘導する。
  • エキスパート損失は、エキスパートデータのミニバッチに適用され、ハイパーパrameter λ_expert がポリシー更新への影響を制御する。
  • トレーニングの安定性と収束性を向上させるために、Kronecker因数分解された自然勾配最適化を用いた信頼領域アプローチを採用する。
  • 本手法は、固定されたエキスパートデモンストレーションとカリキュラム学習なしに、モンテズマのレヴェンとViZDoomのMyWayHomeで評価された。
  • γ = 0.995 および λ_expert = 0.125, 0.25, または 0.5 といったハイパーパrameterが、性能最適化のために調整された。

実験結果

リサーチクエスチョン

  • RQ1エキスパート拡張型アクタ・クリティック学習は、スパarsity報酬環境においてエキスパートのデモンストレーションを上回る性能を達成できるか?
  • RQ2エキスパートデータとACKTRを組み合わせることで、モンテズマのレヴェンのような環境におけるサンプル効率と探索が向上するか?
  • RQ3カリキュラム学習や追加の補助報酬なしに、本手法はViZDoomのMyWayHome迷路で効果的なナビゲーションを学習できるか?
  • RQ4λ_expert と γ の観点から、エキスパート損失とポリシー勾配損失の最適なバランスは何か?
  • RQ5本手法は報告されていない環境のバグを活用しており、エキスパートの行動軌跡を上回る性能を達成できるか?

主な発見

  • エキスパート拡張型アクタ・クリティック手法は、モンテズマのレヴェンで平均27,052点を記録し、最高の実行では804,900点に達した。評価の86%でエキスパートの行動軌跡を上回った。
  • 一部のロールアウトでは、モンテズマのレヴェンに報告されていなかったバグを活用し、最大804,900点のスコアを達成した。
  • 近似的に完璧なエキスパートデモンストレーションを用いても、行動クラッシング(behavioral cloning)はわずか575点にとどまり、本手法はそれを大きく上回った。
  • ViZDoomのMyWayHome迷路では、500万ステップのアクションで強力な性能を発揮したが、カリキュラム学習なしのモデルフリーACKTRベースラインは失敗した。
  • 最良のハイパーパrameterは γ = 0.995 および λ_expert = 0.125 であり、λ_expert が高すぎたり低すぎたりすると性能が著しく低下した。
  • 中央値のポリシーを用いた場合、16%のケースでエキスパートデータ自体を上回る性能を達成した。ベストパフォーマンスのポリシーでは、86%のケースでエキスパートデータを上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。