Skip to main content
QUICK REVIEW

[論文レビュー] MADE: Exploration via Maximizing Deviation from Explored Regions

Tianjun Zhang, Paria Rashidinejad|arXiv (Cornell University)|Jun 18, 2021
Reinforcement Learning in Robotics参考文献 105被引用数 11
ひとこと要約

本論文は、強化学習における探索のための新規手法MADEを提案する。この手法は、RLの目的関数に適応的正則化項を追加することで、以前に訪問された状態行動領域からの逸脱を最大化する。MADEはMiniGrid やDeepMind Control Suiteといったスパarsely-rewarded環境で、従来の内因的好奇心およびカウントベースのベースラインを上回る最先端のサンプル効率を達成する。この手法は、シンプルで即座に統合可能な内因的報酬メカニズムを備えている。

ABSTRACT

In online reinforcement learning (RL), efficient exploration remains particularly challenging in high-dimensional environments with sparse rewards. In low-dimensional environments, where tabular parameterization is possible, count-based upper confidence bound (UCB) exploration methods achieve minimax near-optimal rates. However, it remains unclear how to efficiently implement UCB in realistic RL tasks that involve non-linear function approximation. To address this, we propose a new exploration approach via extit{maximizing} the deviation of the occupancy of the next policy from the explored regions. We add this term as an adaptive regularizer to the standard RL objective to balance exploration vs. exploitation. We pair the new objective with a provably convergent algorithm, giving rise to a new intrinsic reward that adjusts existing bonuses. The proposed intrinsic reward is easy to implement and combine with other existing RL algorithms to conduct exploration. As a proof of concept, we evaluate the new intrinsic reward on tabular examples across a variety of model-based and model-free algorithms, showing improvements over count-only exploration strategies. When tested on navigation and locomotion tasks from MiniGrid and DeepMind Control Suite benchmarks, our approach significantly improves sample efficiency over state-of-the-art methods. Our code is available at https://github.com/tianjunz/MADE.

研究の動機と目的

  • 高次元かつスパース報酬の強化学習環境において、従来のカウントベースのUCB手法が非線形関数近似のため失敗する状況における、効率的探索の課題に対処すること。
  • 表形式設定を超えた一般化可能な、理論的裏付けのある実用的内因的探索ボーナスを開発すること。
  • 過去のカバレッジが低い領域を積極的に探索するようポリシーを適応的に促進する正則化項を構築すること。
  • 新しい正則化項を標準的なRL目的関数に統合した、証明可能に収束するアルゴリズムを提供すること。
  • 本手法を表形式および連続的制御ベンチマークで実証的に検証し、既存の内因的報酬手法を上回る優れた性能を示すこと。

提案手法

  • 本手法は、未探索領域における訪問密度を高めるよう促進する項を追加した正則化RL目的関数を導入する。この項は $ L_k(d^\pi) = J(d^\pi) + \tau_k \sum_{s,a} \sqrt{\frac{d^\pi(s,a)}{\rho^{k}_{\text{cov}}(s,a)}} $ として定義される。
  • 正則化項は、過去のカバレッジ $ \rho^{k}_{\text{cov}} $ が低い領域で次のポリシーの訪問密度 $ d^\pi $ を大きくすることを促進し、探索済み領域からの逸脱を効果的に最大化する。
  • アルゴリズムは近似可能な計画オракルを用いて正則化目的関数を解き、やや弱い仮定のもとでグローバル最適解への収束を保証する。
  • 正則化項から導かれる内因的報酬は計算が単純で、既存の任意のRLアルゴリズムに即座に統合可能なボーナスとして容易に組み合わせられる。
  • 本手法はUCBスタイルの探索に裏付けられているが、分散依存のボーナスの代わりに訪問密度に基づく逸脱測度を用いることで、価値関数の分散を推定する必要を回避する。
  • 本手法は表形式および連続的制御設定の両方で評価され、GitHubで実装が公開されている。

実験結果

リサーチクエスチョン

  • RQ1非線形関数近似を用いる場合、表形式を超えたUCBスタイルの探索ボーナスを効果的に一般化できるか?
  • RQ2価値関数の分散推定に依存せずに、カバレッジが低い領域での探索を促進する内因的報酬をどのように設計できるか?
  • RQ3探索済み領域からの逸脱を最大化することは、スパース報酬環境におけるサンプル効率の向上に寄与するか?
  • RQ4提案された正則化項は、既存のRLアルゴリズムに最小限の変更で効率的に最適化可能で統合可能か?
  • RQ5サンプル効率およびロバスト性の観点から、本手法は最先端の内因的探索ベースラインを上回るか?

主な発見

  • MADEはMiniGridナビゲーションタスクにおいて、カウントベースおよびキュリオシティベースのベースラインを上回る顕著なサンプル効率の向上を達成した。
  • DeepMind Control Suiteのロケモーションタスクにおいて、MADEは最先端の探索手法よりも少ない環境インタラクション回数で、より高い最終性能を達成した。
  • 表形式設定において、MADEはすべてのベースラインを上回るサンプル効率を達成し、正規化されたサンプル使用量が常に他の手法より低かった。
  • MADEから導かれる内因的報酬は、モデルフリーおよびモデルベースのRLアルゴリズムの両方で有効であり、広範な互換性を示した。
  • 本手法は、他の内因的報酬手法で見られる「脱線」や「深刻な忘却」などの一般的な失敗モードを回避した。
  • 本手法はハイパーパrameterの選択に対してロバストであり、多様な環境においても強力な性能を維持した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。