Skip to main content
QUICK REVIEW

[論文レビュー] Successor-Predecessor Intrinsic Exploration

Changmin Yu, Neil Burgess|arXiv (Cornell University)|May 24, 2023
Reinforcement Learning in Robotics被引用数 4
ひとこと要約

本論文は、将来の状態の占有を捉える予測的後続表現(SR)と、過去の状態の期待をエンコードする後向きの先行表現(PR)を組み合わせることで、スパarsely-rewarded環境における構造に配慮した効率的な探索を促進する、新しい内因的探索手法であるSuccessor-Predecessor Intrinsic Exploration(SPIE)を提案する。SPIEは、先行手法よりもサンプル効率と漸近的性能を向上させ、Montezuma’s Revengeではたった8×10⁶フレームでほぼ最適性能を達成しており、DQN-SR や RND よりもはるかに高速である。

ABSTRACT

Exploration is essential in reinforcement learning, particularly in environments where external rewards are sparse. Here we focus on exploration with intrinsic rewards, where the agent transiently augments the external rewards with self-generated intrinsic rewards. Although the study of intrinsic rewards has a long history, existing methods focus on composing the intrinsic reward based on measures of future prospects of states, ignoring the information contained in the retrospective structure of transition sequences. Here we argue that the agent can utilise retrospective information to generate explorative behaviour with structure-awareness, facilitating efficient exploration based on global instead of local information. We propose Successor-Predecessor Intrinsic Exploration (SPIE), an exploration algorithm based on a novel intrinsic reward combining prospective and retrospective information. We show that SPIE yields more efficient and ethologically plausible exploratory behaviour in environments with sparse rewards and bottleneck states than competing methods. We also implement SPIE in deep reinforcement learning agents, and show that the resulting agent achieves stronger empirical performance than existing methods on sparse-reward Atari games.

研究の動機と目的

  • 局所的な信号(訪問回数など)が、ボトルネックのような構造的に重要な状態へ向かうのをガイドできないスパarsely-rewarded環境における非効率的探索を是正すること。
  • 後向きの情報(先行構造)と予測的情報(後続表現)を統合し、よりグローバルに配慮した内因的報酬を生成すること。
  • 離散的および連続的MDPの両方において、サンプル効率と漸近的報酬を向上させる一般化された内因的探索フレームワークを構築すること。
  • DQNにSPIEを統合し、RND や DQN-SR といった最先端手法と比較することで、SPIEの有効性を深層強化学習の文脈で検証すること。
  • SPIEが、構造的環境における生物学的に妥当なサイクル的探索行動を、外部の形状付けなしに再現できる可能性を調査すること。

提案手法

  • SPIEは、将来の状態の占有を捉える後続表現(SR)と、期待される過去の状態をエンコードする先行表現(PR)を組み合わせることで内因的報酬を構築する。
  • 内因的報酬は、SRとPRの重み付き和として定義され、将来の到達可能性が高く、かつ状態空間における接続性に重要である状態を優先的に探索できるようにする。
  • 離散的MDPでは、表形式のSRとPRを用いて、将来および過去の状態訪問の期待値に基づき内因的報酬を計算する。
  • 連続的MDPでは、SPIEは「先行特徴」——高次元状態空間におけるPRのニューラルネットワークベースの一般化——を導入し、後向き構造を捉える。
  • SPIEは、外部報酬にSPIEの内因的報酬を追加することで深層Qネットワーク(DQN)に統合され、オンライン時系列差分学習が可能になる。
  • SPIEはモジュール型に設計されており、任意の深層RLエージェントと互換性があり、既存のアルゴリズムに即座に統合可能である。

実験結果

リサーチクエスチョン

  • RQ1後向き(先行)と予測的(後続)の情報を組み合わせることで、スパarsely-rewarded環境における探索効率が向上するか?
  • RQ2SPIEは、局所的な訪問回数や将来の可能性に依存する手法よりも、ボトルネック状態をより効果的に特定・通過できるか?
  • RQ3Atariゲームにおいて、RND や DQN-SR といった最先端の内因的探索手法と比較して、SPIEのサンプル効率と漸近的性能はどの程度か?
  • RQ4外部の形状付けなしに、SPIEは構造的グリッドワールドにおけるクラスタ間のサイクリングといった生物学的に妥当な探索行動を生成できるか?
  • RQ5SPIEを深層RLエージェントに統合した際の学習ダイナミクスと最終的性能への影響は何か?特に、連続的および離散的制御タスクにおいて。

主な発見

  • SPIEは、Montezuma’s Revengeでたった約8×10⁶の学習フレームでほぼ漸近的性能に到達したのに対し、DQN-SRは約2.4×10⁷フレームを要し、低いスコアに留まった。
  • Freeway環境では、SPIEはDQN、DQN-MMC、RND、DQN-SRを上回り、平均スコア27.5(±0.2)を記録した。RNDの28.2やDQN-SRの29.4を上回った。
  • Gravitarでは、SPIEが平均1223.0(±408.9)のスコアを達成し、RND(714.1)やDQN-SR(457.4)を大きく上回った。
  • Private Eyeでは、SPIEが488.2(±390.9)のスコアを記録し、RND(61.3)やDQN-SR(104.4)を上回り、複雑な探索タスクにおける頑健性を示した。
  • グリッドワールドでは、SPIEが明確な状態クラスタ間をサイクリングする生物学的に妥当な探索行動を示し、構造に配慮した探索であることを示した。
  • テストされた6つのハードな探索Atariゲームすべてにおいて、SPIEをDQNに統合することで一貫した改善が得られ、競合手法よりも優れたサンプル効率と高い漸近的報酬を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。