Skip to main content
QUICK REVIEW

[論文レビュー] On the Importance of Exploration for Generalization in Reinforcement Learning

Yiding Jiang, J. Zico Kolter|arXiv (Cornell University)|Jun 8, 2023
Reinforcement Learning in Robotics被引用数 5
ひとこと要約

本稿では、Ede(Exploration via Distributional Ensemble)を提案する。Edeは、推定されたエピステミック的不確実性の高い状態の探索を促進するためのQ値分布のアンサンブルを用いる、価値ベースの強化学習手法であり、文脈的MDPにおける一般化性能を向上させる。EdeはProcgenおよびCrafterベンチマークの両方で最先端性能を達成し、従来の価値ベースおよび方策最適化手法を上回る。これは、探索を一般化の主要なメカニズムとして明示的に活用した結果である。

ABSTRACT

Existing approaches for improving generalization in deep reinforcement learning (RL) have mostly focused on representation learning, neglecting RL-specific aspects such as exploration. We hypothesize that the agent's exploration strategy plays a key role in its ability to generalize to new environments. Through a series of experiments in a tabular contextual MDP, we show that exploration is helpful not only for efficiently finding the optimal policy for the training environments but also for acquiring knowledge that helps decision making in unseen environments. Based on these observations, we propose EDE: Exploration via Distributional Ensemble, a method that encourages exploration of states with high epistemic uncertainty through an ensemble of Q-value distributions. Our algorithm is the first value-based approach to achieve state-of-the-art on both Procgen and Crafter, two benchmarks for generalization in RL with high-dimensional observations. The open-sourced implementation can be found at https://github.com/facebookresearch/ede .

研究の動機と目的

  • 表現学習を超えて、探索戦略が深層強化学習における一般化に与える影響が顕著かどうかを調査すること。
  • エージェントが構造的に類似したが多様な環境で訓練される文脈的MDP(CMDP)において、探索が一般化の鍵となる要因であるかを特定すること。
  • エピステミック的不確実性を明示的にターゲットにした探索を促進する手法を開発し、未知の環境への一般化を向上させること。
  • 1つの環境での探索によって得られた知識が、同じファミリーに属する他の未知の環境においても利用可能である知識に転送可能であるかを示すこと。
  • モデルフリーで価値ベースのアプローチを用いて、ProcgenやCrafterのような一般化ベンチマークで最先端性能を達成すること。

提案手法

  • Edeは、エピステミック的不確実性をモデル化するためにQ値分布のアンサンブルを用い、アンサンブルの各メンバーがリターンの分布を予測する。
  • アンサンブル全体を通じて不確実性推定値を計算し、エージェントが高いエピステミック的不確実性を示す状態(さらなる探索が求められる領域)を特定する。
  • 探索は、アンサンブル予測の不確実性に基づいたUCBスタイルのボーナスによって誘導され、不確実性の高い状態への訪問を促進する。
  • 効率的な推論のため、Crafter実験ではトフリンサンプリングを採用し、ProcgenではUCBを用いる。ハイパーパramータはアブレーションを用いて最適化された。
  • 特徴抽出器は、すべてのアンサンブルヘッドからの勾配を同時に用いて訓練され、共有表現学習が不確実性推定と整合するように保証される。
  • 本手法は、Huber損失と分位数ベースの価値推定を用いるQR-DQN(Quantile Regression DQN)フレームワーク内で適用される。
Figure 1 : Exploration can help agents learn about parts of the environment which may be useful at test time, even if they are not needed for the optimal policy on the training environments.
Figure 1 : Exploration can help agents learn about parts of the environment which may be useful at test time, even if they are not needed for the optimal policy on the training environments.

実験結果

リサーチクエスチョン

  • RQ1表現学習を超えて、探索戦略が文脈的MDPにおける一般化性能に顕著な影響を与えるか?
  • RQ21つの環境で得た探索による知識が、同じファミリーに属する他の未知の環境における意思決定を改善するのに転送可能か?
  • RQ3Q値分布のアンサンブルによるエピステミック的不確実性推定が、高次元の観測空間における一般化を向上させる探索を効果的に誘導できるか?
  • RQ4方策最適化やモデルベースアプローチに依存せず、探索を明示的にターゲットにした価値ベース手法で、深層RLにおける最先端の一般化性能を達成できるか?
  • RQ5探索ボーナス係数やアンサンブルサイズといったハイパーパramータの選択に対して、本手法はどれほどロバストか?

主な発見

  • EdeはProcgenベンチマークで最先端性能を達成し、SAC や DQN-BC といった強力な方策最適化ベースライン、およびモデルベースベースラインを上回る。
  • Crafterベンチマークでは、従来の価値ベース手法を上回り、方策最適化手法と同等またはそれ以上の性能を示し、優れた一般化性能と高いサンプル効率を実証した。
  • 不確実性に基づく探索を用いることで、テスト性能が顕著に向上し、特に訓練時において最適な経路が未知環境では最適でない場合に顕著であった。
  • アブレーションスタディにより、すべてのアンサンブルメンバーからの勾配を用いて特徴抽出器を訓練することで性能が向上することが確認された一方、1つのヘッドからのみ勾配を用いると性能が低下した。
  • アルゴリズムはハイパーパramータの選択に対してロバストである:TEEボーナスのλおよびαの異なる値に対しても性能は安定しており、UCBのφに対してもわずかに敏感にとどまる。
  • Edeは、ProcgenおよびCrafterの両方で最先端性能を達成した最初のモデルフリーで価値ベースの手法であり、深層RLにおける一般化の鍵として探索が有効であることを裏付けた。
(a) Tabular CMDP
(a) Tabular CMDP

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。