Skip to main content
QUICK REVIEW

[論文レビュー] Reinforcement Learning Generalization with Surprise Minimization

Jerry Zikun Chen|arXiv (Cornell University)|Apr 26, 2020
Reinforcement Learning in Robotics参考文献 28被引用数 8
ひとこと要約

本稿では、生成的プロシージャル環境における深層強化学習(RL)の一般化を向上させるために、変分オートエンコーダー(VAE)に基づく予測の驚きを最小化する報酬を提案する。VAEを状態の軌道上にオンラインで訓練し、将来の状態を予測して予測の驚きを最小化することで、エージェントは未観測のテストレベルに対してもより頑健で安定した方策を学習する。ProcGenベンチマークにおいて、BossFightでは標準PPOを上回る訓練速度とテストパフォーマンスを達成するが、CoinRunではVAEの高い表現能力のため過学習が生じる。

ABSTRACT

Generalization remains a challenging problem for deep reinforcement learning algorithms, which are often trained and tested on the same set of deterministic game environments. When test environments are unseen and perturbed but the nature of the task remains the same, generalization gaps can arise. In this work, we propose and evaluate a surprise minimizing agent on a generalization benchmark to show an additional reward learned from a simple density model can show robustness in procedurally generated game environments that provide constant source of entropy and stochasticity.

研究の動機と目的

  • 未観測の生成的プロシージャル環境でテストされた際の深層RLエージェントの一般化ギャップを解消すること。
  • 学習済み密度モデルを通じて将来の驚きを最小化することで、エントロピー的で確率的な環境における頑健性が向上するかを調査すること。
  • 標準的なRLアルゴリズムを超えて一般化を向上させるために、驚き最小化を内生的報酬信号として有効に活用できるかを評価すること。
  • 異なる密度モデルと報酬スケーリングのハイパーパrameterが一般化性能に与える影響を調査すること。

提案手法

  • エージェントの経験から得られる状態観測値を用いて、現在の方策下での状態分布の周辺分布をモデル化するため、VAEをオンラインで訓練する。
  • 各状態に対して潜在分布(平均と分散)を出力することで、状態再構成確率、ひいては驚きの推定が可能になる。
  • 驚きは再構成状態の負の対数尤度として計算され、将来の予測誤差を最小化するための内生的報酬信号として機能する。
  • 驚き報酬はハイパーパrameter α を用いてタスク報酬と組み合わせられ、内生的および外生的学習目的のバランスをとる。
  • VAEと方策はバッチ処理・オンライン形式で共同訓練され、同じ経験バッチを用いて各学習ステップで両者を更新する。
  • 本手法は、標準PPO訓練の下でProcGenベンチマークの2つのゲーム(CoinRun および BossFight)で評価された。

実験結果

リサーチクエスチョン

  • RQ1学習済み密度モデルによる驚き最小化は、生成的プロシージャル環境における深層RLの一般化を向上させることができるか?
  • RQ2未観測のレベルにおけるテストパフォーマンスの観点から、驚き最小化報酬は標準PPOと比較してどのように異なるか?
  • RQ3密度モデルの選択(例:VAE 対 ガウス分布)が一般化性能および頑健性に与える影響は何か?
  • RQ4驚き報酬の大きさを制御するハイパーパrameter α が、タスク学習と一般化のバランスに与える影響は何か?
  • RQ5内生的驚き信号は、訓練およびテスト中に環境のエントロピーに適応するためのエージェントの適応にどのように寄与するか?

主な発見

  • 驚き最小化報酬はCoinRunにおける学習速度を顕著に向上させ、PPO + VAEはベースラインPPOよりも早期に高いタスク報酬を達成した。
  • BossFight環境では、初期段階の過学習を経て、PPO + VAEエージェントがテストセットで標準PPOと同等のパフォーマンスを達成した。これは、最終的には一般化性能の向上が見られたことを示している。
  • CoinRunでは、PPO + VAEエージェントがVAEの高い表現能力のため、訓練レベルに過学習し、高速な学習にもかかわらずテストパフォーマンスが悪化した。
  • 驚き報酬がタスク報酬と適切にバランスされた場合にのみ、報酬が最も効果的であり、過剰に強い驚き信号はパフォーマンスを劣化させた。
  • 本手法は、内生的驚き最小化がエントロピーの高い環境で頑健性を向上させることを示しており、安定的かつ予測可能な行動を促進する。
  • 結果から、驚き最小化は一貫した生存が求められるタスク(例:BossFight)ではより効果的であるのに対し、ゴール探索が中心のタスク(例:CoinRun)では記憶に依存する傾向があるため、一般化にやや劣ることが示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。