Skip to main content
QUICK REVIEW

[論文レビュー] Rewarding Episodic Visitation Discrepancy for Exploration in Reinforcement Learning

Mingqi Yuan, Bo Li|arXiv (Cornell University)|Sep 19, 2022
Reinforcement Learning in Robotics被引用数 5
ひとこと要約

本論文は、エピソード間の訪問確率分布のRényi発散に基づく訪問差異を用いて持続的な探索ボーナスを生成する、計算効率の高い内因的探索手法であるRewarding Episodic Visitation Discrepancy (REVD)を提案する。k近傍法推定器とランダムに初期化された状態エンコーダを用いることで、補助モデルや表現学習を回避し、サンプル効率を著しく向上させ、AtariおよびPyBullet環境において最先端の手法を上回る性能を発揮する。

ABSTRACT

Exploration is critical for deep reinforcement learning in complex environments with high-dimensional observations and sparse rewards. To address this problem, recent approaches proposed to leverage intrinsic rewards to improve exploration, such as novelty-based exploration and prediction-based exploration. However, many intrinsic reward modules require sophisticated structures and representation learning, resulting in prohibitive computational complexity and unstable performance. In this paper, we propose Rewarding Episodic Visitation Discrepancy (REVD), a computation-efficient and quantified exploration method. More specifically, REVD provides intrinsic rewards by evaluating the Rényi divergence-based visitation discrepancy between episodes. To make efficient divergence estimation, a k-nearest neighbor estimator is utilized with a randomly-initialized state encoder. Finally, the REVD is tested on Atari games and PyBullet Robotics Environments. Extensive experiments demonstrate that REVD can significantly improves the sample efficiency of reinforcement learning algorithms and outperforms the benchmarking methods.

研究の動機と目的

  • 深層強化学習における内因的報酬の消滅問題、特に報酬が疎で次元が高い環境において、これを解決すること。
  • 複雑な表現学習や補助モデルを回避する、計算効率の高い探索手法を開発すること。
  • エピソード単位で測定可能な、探索の改善度を定量化する指標を提供すること。
  • モデルの複雑さを増さずに、離散的および連続的制御タスクにおけるサンプル効率とポリシー性能を向上させること。

提案手法

  • REVDは、連続する2エピソードにおける状態訪問分布の間のRényi発散に基づいて内因的報酬を計算する。
  • 発散は、現在のエピソードと直前のエピソードからの状態に適用されたk近傍法(k-NN)推定器を用いて推定される。
  • 表現学習や事前学習済み表現を必要としないため、ランダムに初期化された状態エンコーダを用いて状態を埋め込む。
  • エピソード記憶領域やデータベースを必要としないため、エピソードにわたる持続的な探索インcentiveを実現できる。
  • 内因的報酬は、ある状態とその近傍状態との間のk-NN距離の差分から導出される。
  • PPO や A2C といった標準的な強化学習アルゴリズムに統合可能であり、そのコアアーキテクチャを変更しない。

実験結果

リサーチクエスチョン

  • RQ1エピソード訪問差異に基づく計算効率の高い探索手法が、従来の内因的報酬手法よりもサンプル効率で優れているか。
  • RQ2記憶領域や表現学習に依存せずに、エピソードにわたって強い探索インセンティブを維持できるか。
  • RQ3報酬が疎な環境において、REVDはRE3、RIDE、NGUといった最先端の手法と比較して、性能と安定性に優れているか。
  • RQ4REVDは、離散的(Atari)および連続的制御(PyBullet)タスクの両方で学習効率を向上させられるか。
  • RQ5提案された訪問差異指標は、エピソード単位での探索改善度を信頼性があり定量的に示す指標として有効か。

主な発見

  • REVDは、すべての6つのAtariゲームにおいて、報酬が密集している場合と疎な場合の両方でサンプル効率を著しく向上させ、PPO+RIDE、PPO+RE3、およびvanilla PPOを上回った。
  • Atariの報酬が疎な環境において、REVDはAssault環境で振動的だが持続的な学習曲線を示し、強いかつ持続的な探索インセンティブを示した。
  • PyBulletロボティクス環境では、PPO+REVDがWalker 2Dで最高の平均エピソード報酬を達成し、HopperおよびHumanoidタスクでは最も速い収束を示した。
  • Cart Poleでは、PPO+REVDが最小限の環境ステップ数でタスクを解決し、優れたサンプル効率を示した。
  • A2C+REVDは、Half CheetahおよびHumanoidを含むすべてのPyBulletタスクで、vanilla A2Cを上回った。これはREVDの異なる強化学習アルゴリズムへの頑健性を裏付けた。
  • REVDは、評価されたすべてのタスクにおいて、報酬が密集している場合と疎な場合の両方でベンチマーク手法を一貫して上回り、その有効性と一般化能力を確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。