[論文レビュー] State Entropy Maximization with Random Encoders for Efficient Exploration
本論文は、固定されたランダムエンコーダーを用いて低次元表現を抽出することで、高次元観測空間における安定的かつスケーラブルなエントロピー推定を可能にする、計算効率の高い探索手法RE3を提案する。RE3は、DeepMind Control Suite、MiniGrid、Atariベンチマークにおいて、モデルフリーおよびモデルベースRLの両方で、学習済み表現や補助モデルを必要としない手法よりも顕著にサンプル効率を向上させる。
Recent exploration methods have proven to be a recipe for improving sample-efficiency in deep reinforcement learning (RL). However, efficient exploration in high-dimensional observation spaces still remains a challenge. This paper presents Random Encoders for Efficient Exploration (RE3), an exploration method that utilizes state entropy as an intrinsic reward. In order to estimate state entropy in environments with high-dimensional observations, we utilize a k-nearest neighbor entropy estimator in the low-dimensional representation space of a convolutional encoder. In particular, we find that the state entropy can be estimated in a stable and compute-efficient manner by utilizing a randomly initialized encoder, which is fixed throughout training. Our experiments show that RE3 significantly improves the sample-efficiency of both model-free and model-based RL methods on locomotion and navigation tasks from DeepMind Control Suite and MiniGrid benchmarks. We also show that RE3 allows learning diverse behaviors without extrinsic rewards, effectively improving sample-efficiency in downstream tasks. Source code and videos are available at https://sites.google.com/view/re3-rl.
研究の動機と目的
- 深層強化学習に一般的に見られる高次元観測空間における効率的探索の課題に対処すること。
- 表現学習や補助モデルを必要とせずに、安定的かつ計算効率の良い状態エントロピー推定を可能にすること。
- ランダムに初期化されたエンコーダーが、状態エントロピー推定に意味のある表現を提供できるかどうかを調査すること。
- 状態エントロピーに基づく内因的報酬の形状付けを通じて、モデルフリーおよびモデルベースRLアルゴリズムのサンプル効率を向上させること。
- スパース報酬環境における多様な行動を促進することで、下流タスクのための有効な事前学習を可能にすること。
提案手法
- ランダムに初期化された畳み込みエンコーダーの潜在空間において、k近傍(k-NN)エントロピー推定器を用いて状態エントロピーを推定する。
- 訓練中を通じてエンコーダーの重みを固定し、勾配更新や表現学習の目的関数を排除する。
- 固定された潜在表現上でのk-NN推定器を用いて、状態エントロピーに比例する内因的報酬を計算する。
- ポリシーまたは価値関数の学習プロセスを変更せずに、標準的なRLアルゴリズム(例:A2C、SAC)に内因的報酬を統合する。
- 畳み込みアーキテクチャのインダクティブバイアスを活用し、訓練なしでも意味のある状態類似性表現を保証する。
- 最小限のハイパーパramータチューニングで、モデルフリー(例:A2C、SAC)、モデルベース(例:Dreamer)、オンポリシー設定のすべてにこの手法を適用する。
実験結果
リサーチクエスチョン
- RQ1固定されたランダムに初期化されたエンコーダーは、高次元環境における状態エントロピー推定に安定的で意味のある表現空間を提供できるか?
- RQ2固定されたランダムエンコーダー空間内でk-NN推定を用いて状態エントロピーを最大化することで、深層強化学習におけるサンプル効率が向上するか?
- RQ3表現学習や補助モデルに依存する最先端の探索手法と比較して、RE3はどのように性能を発揮するか?
- RQ4RE3は、スパース報酬環境における多様な行動を促進することで、下流タスクのための有効な事前学習を可能にできるか?
- RQ5視覚的に複雑な環境、例えばAtariゲームのような環境でも、この手法はスケーラブルかつ有効に機能するか?
主な発見
- MiniGridのDoorKey-8x8環境において、RE3は240万環境ステップで平均エピソードリターン0.49を達成し、A2C + ICM(0.20)やA2C + RNDに比べて非自明な方策を学習できなかった。
- MiniGridのEmpty-16x16環境では、RE3が事前学習を可能にし、A2C + RE3 + PTがDoorKeyタスクにおいて優れたサンプル効率を示した。
- Atariゲームでは、RainbowやRainbow + SE(対照的学習)に比べてRE3がサンプル効率を向上させ、特にモンテズマのレヴィンのような難易度の高い探索ゲームで顕著であった。
- データオーグメンテーションがコンパクトな状態埋め込みと互換性のないMiniGrid環境では、表現学習を必要とする手法(例:対照的学習)よりもRE3が優れた性能を示した。
- 計算的に効率的であり、エンコーダーに勾配更新を一切必要としないため、既存のRLパイプラインへの統合が容易で実用的である。
- 外在的報酬が存在しない状況でも、RE3は多様な行動の学習を可能にし、大規模で空っぽな状態空間における効果的な内因的探索を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。