[論文レビュー] Curious Exploration and Return-based Memory Restoration for Deep Reinforcement Learning
本論文は、報酬がスパarsityで、成功/失敗のバイナリーリワードしか与えられない環境において、強化学習エージェントを訓練するための強化学習フレームワークを提案する。Curious Explorationとリターンベースメモリリカバリ(RMR)を組み合わせることで、報酬設計に依存せず、エージェントが一貫してゴールを獲得する能力を発揮する。DDPGエージェントは、RMRを用いることで、HFOサッカーシミュレーションの複雑な環境において、平均97.8%の成功率を達成し、標準的なDDPGや好奇心のみのベースラインを上回った。
Reward engineering and designing an incentive reward function are non-trivial tasks to train agents in complex environments. Furthermore, an inaccurate reward function may lead to a biased behaviour which is far from an efficient and optimised behaviour. In this paper, we focus on training a single agent to score goals with binary success/failure reward function in Half Field Offense domain. As the major advantage of this research, the agent has no presumption about the environment which means it only follows the original formulation of reinforcement learning agents. The main challenge of using such a reward function is the high sparsity of positive reward signals. To address this problem, we use a simple prediction-based exploration strategy (called Curious Exploration) along with a Return-based Memory Restoration (RMR) technique which tends to remember more valuable memories. The proposed method can be utilized to train agents in environments with fairly complex state and action spaces. Our experimental results show that many recent solutions including our baseline method fail to learn and perform in complex soccer domain. However, the proposed method can converge easily to the nearly optimal behaviour. The video presenting the performance of our trained agent is available at http://bit.ly/HFO_Binary_Reward.
研究の動機と目的
- 報酬がスパースで、成功/失敗のバイナリーリワードしか与えられない環境において、深層強化学習エージェントを訓練する課題に対処すること。
- 手作業で設計された報酬関数に依存しないようにし、環境が提供する次の状態とバイナリーリワード信号のみを用いた、元の強化学習定式化に従うこと。
- 探索の強化と記憶保持の向上により、複雑な行動空間と状態空間におけるサンプル効率と学習収束を改善すること。
- 報酬設計なしに、内在的好奇心と記憶優先順位付けの組み合わせにより、HFOドメインでほぼ最適な行動を達成できるかを実証すること。
提案手法
- 予測ベースの探索戦略としてのCurious Explorationを導入し、学習済みのダイナミクスモデルにおける予測誤差によって、未知で不確実な状態を探索するようにエージェントを駆動する。
- リターンベースメモリリカバリ(RMR)機構を採用し、累積リターンが高い経験を優先して保存・再利用することで、リプレイバッファ内の価値ある記憶の密度を高める。
- 報酬設計なしに、元の強化学習定式化に従う標準的なDDPGアルゴリズムをポリシー学習の基盤として用いる。
- 現在の状態と行動から次の状態を推定する状態ダイナミクス予測器を訓練し、その予測誤差を内在的好奇心報酬として用いる。
- RMRを用いて記憶ポリシーを変更し、高いリターンに繋がる遷移を優先することで、重要な正の経験軌道を保持する。
- 環境のバイナリーリワードと内在的好奇心報酬を組み合わせ、スパース報酬環境における探索と学習を誘導する。
実験結果
リサーチクエスチョン
- RQ1バイナリーリワードのみで報酬設計なしに、DRLエージェントがHalf Field Offenseドメインでゴールを獲得できるか?
- RQ2Curious Explorationは、ランダム探索や標準的なDDPGと比較して、スパース報酬環境における学習効率をどのように向上させるか?
- RQ3リターンベースメモリリカバリは、高リターン経験を保持することで、どの程度サンプル効率と学習収束を向上させるか?
- RQ4好奇心とメモリリカバリの組み合わせは、スパース報酬環境において標準的なDDPGが失敗するのを克服できるか?
主な発見
- バイナリーリワード関数のみを用いたDDPGエージェントは、5回の訓練ラウンドで平均0.000の成功率を示し、完全に失敗した。
- DDPG + Curious Exploration(CE)エージェントは、平均91.9%の成功率を達成し、好奇心のみでもスパース環境における学習が向上することを示した。
- DDPG + CE + RMRエージェントは、平均97.8%の成功率を達成し、両方のベースラインを顕著に上回り、最適な行動への収束が速くなった。
- RMR機構は、重要な正の経験軌道を効果的に保持し、スパースな正の信号の早期忘却を防ぎ、安定した学習を可能にした。
- 初回ボール接触時および初ゴール時に予測誤差と探索報酬が急激に上昇したことで、好奇心がタスク関連の重要な行動に向けられることが確認された。
- 報酬設計なしに、標準的な強化学習定式化のみに依存することで、複雑で高次元の行動空間と状態空間の環境でも学習が成功した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。