Skip to main content
QUICK REVIEW

[論文レビュー] Bayesian Curiosity for Efficient Exploration in Reinforcement Learning

Tom Blau, Lionel Ott|arXiv (Cornell University)|Nov 20, 2019
Reinforcement Learning in Robotics参考文献 33被引用数 6
ひとこと要約

本稿では、学習済みの潜在空間におけるベイジアン線形回帰を用いて状態の新奇性を測定し、探索を誘導する計算的に効率的な内因的報酬手法、ベイジアン・キュリオシティを提案する。未到達領域における不確実性を報酬化することで、特に報酬が疎な状況下において、高次元で連続的な制御タスクの学習を加速する。シミュレーションおよび実ロボット実験の両方で、$\epsilon$-greedyおよびRNDベースラインを上回る性能を示した。

ABSTRACT

Balancing exploration and exploitation is a fundamental part of reinforcement learning, yet most state-of-the-art algorithms use a naive exploration protocol like $ε$-greedy. This contributes to the problem of high sample complexity, as the algorithm wastes effort by repeatedly visiting parts of the state space that have already been explored. We introduce a novel method based on Bayesian linear regression and latent space embedding to generate an intrinsic reward signal that encourages the learning agent to seek out unexplored parts of the state space. This method is computationally efficient, simple to implement, and can extend any state-of-the-art reinforcement learning algorithm. We evaluate the method on a range of algorithms and challenging control tasks, on both simulated and physical robots, demonstrating how the proposed method can significantly improve sample complexity.

研究の動機と目的

  • 高次元で連続的な状態空間における非効率な探索によって引き起こされる高いサンプル複雑性を解消すること。
  • 単純な探索戦略(例:$\epsilon$-greedy やガウスノイズ)の限界を克服し、既知の状態を無駄に再訪問する作業を減らすこと。
  • あらゆる最先端の強化学習アルゴリズムと統合可能なスケーラブルでモジュラーな内因的報酬メカニズムを開発すること。
  • 外因的報酬が探索の指針をほとんど与えない報酬が疎な環境におけるサンプル効率を向上させること。
  • ランダムな初期化に対して頑健であり、シミュレーテッドおよび物理的ロボット制御タスクに一般化できることを示すこと。

提案手法

  • 高次元の観測(例:RGB-D画像)を低次元で意味のある表現にマップする学習済みの潜在空間埋め込みを用いる。
  • 潜在状態と予測結果の関係をモデル化するため、ベイジアン線形回帰(BLR)を適用し、モデルの不確実性を推定する。
  • 任意の状態についてBLRモデルの予測分散を計算し、不確実性の指標とする。この値は、以前に観測された状態から離れるほど増加する。
  • モデルの不確実性に比例する内因的報酬信号を生成し、以前に訪問された領域から遠い状態を探索するようエージェントを誘導する。
  • ポリシー・ネットワークや価値関数のアーキテクチャを変更せずに、標準的な強化学習アルゴリズム(例:TRPO、SAC)に内因的報酬を統合する。
  • 状態の類似性と相違性を保持するため、対照的損失を用いて潜在空間埋め込みと強化学習ポリシーをエンドツーエンドで同時に学習する。

実験結果

リサーチクエスチョン

  • RQ1ベイジアン不確実性に基づく内因的報酬信号は、高次元の観測を持つ連続的制御タスクにおけるサンプル効率を向上させることができるか?
  • RQ2$\epsilon$-greedyおよびRNDと比較して、ベイジアン・キュリオシティの収束速度と初期化に対する頑健性はいかがなっているか?
  • RQ3報酬が疎な環境や、成功状態と失敗状態の間にボトルネックがあるような複雑な状態空間幾何構造を持つ環境では、本手法がより優れた性能を示すか?
  • RQ4本手法は、生のRGB-D画像を含むさまざまな観測モalityに一般化できるか?
  • RQ5各エピソードの実行コストが高い現実世界のロボット制御タスクに、本手法はスケーラブルに適用できるか?

主な発見

  • ベイジアン・キュリオシティは、サンプル複雑性を顕著に低減した:視覚的運動制御タスクでは、RNDや通常のTRPOよりも3倍少ないタイムステップで高い性能を達成した。
  • 本手法は複数のランダムシードにおける性能の第1四分位数を向上させ、初期化に対する頑健性がベースラインより優れていることを示した。
  • 報酬が疎く、成功状態に近い失敗状態が存在するボトルネックを有するグリッピングタスクでは、ベイジアン・キュリオシティがベースラインよりもはるかに速く収束した。ベースラインはほぼ線形の学習曲線を示した。
  • 物理的ロボットアームでは、ベイジアン・キュリオシティはRNDの中央値性能に匹敵したが、第1四分位数での収束が速く、現実世界の設定でも実用的な頑健性を示した。
  • 高次元の視覚的観測空間では、ガウスノイズによる単純な探索戦略に比べ、本手法はより効果的に探索を実行できることを示した。
  • モデルの不確実性に基づく内因的報酬は、外因的報酬が疎または誤解を招く状況下でも、複雑な状態空間における探索を効果的に誘導できた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。