Skip to main content
QUICK REVIEW

[論文レビュー] Directed Exploration for Reinforcement Learning

Zhaohan Daniel Guo, Emma Brunskill|arXiv (Cornell University)|Jun 18, 2019
Reinforcement Learning in Robotics参考文献 18被引用数 9
ひとこと要約

この論文では、報酬ボーナス手法の非定常性問題を回避するため、高不確実性状態を直接的に入ることを目的とした、強化学習における指向的探索を提案する。この手法は、報酬ボーナスに基づく手法に比べて、特にFetchPush やマウンテンカーモデルのようなスパarsely-reward環境において、より効率的かつ安定した探索を達成する。

ABSTRACT

Efficient exploration is necessary to achieve good sample efficiency for reinforcement learning in general. From small, tabular settings such as gridworlds to large, continuous and sparse reward settings such as robotic object manipulation tasks, exploration through adding an uncertainty bonus to the reward function has been shown to be effective when the uncertainty is able to accurately drive exploration towards promising states. However reward bonuses can still be inefficient since they are non-stationary, which means that we must wait for function approximators to catch up and converge again when uncertainties change. We propose the idea of directed exploration, that is learning a goal-conditioned policy where goals are simply other states, and using that to directly try to reach states with large uncertainty. The goal-conditioned policy is independent of uncertainty and is thus stationary. We show in our experiments how directed exploration is more efficient at exploration and more robust to how the uncertainty is computed than adding bonuses to rewards.

研究の動機と目的

  • 非定常な不確実性更新による報酬ボーナスに基づく探索の非効率性を解消すること。
  • 関数近似器が変化する不確実性ボーナスについて追いつくのが遅れることで生じる収束の遅さと不安定性を克服すること。
  • 不確実性推定と方策学習を分離することで、不変の目標指向探索戦略を開発すること。
  • ロボット操作タスクやグリッドワールドのようなスパース報酬環境における探索効率と安定性を向上させること。
  • 不確実性に基づく目標選択が、ランダムな目標サンプリングや報酬ボーナス手法に比べ、探索速度と効果性において優れていることを実証すること。

提案手法

  • 任意の指定された目標状態 $g$ を到達するために、状態-行動ペアから行動を出力する目標に依存する方策 $\pi(s,g)$ を学習する。
  • ダイナミクスモデルにおける予測誤差として計算される不確実性推定値を用いて、高不確実性状態を目標として特定する。
  • 不確実性に基づいて目標状態を選択し、事前に学習済みの目標に依存する方策を用いて、それらの状態へ直接到達を試みる。
  • 目標に依存する方策と不確実性計算を分離することで、不確実性が変化しても方策が安定したまま保たれるようにする。
  • 収集された軌道を共有のリプレイバッファにフィードバックすることで、既存のオフポリシー強化学習アルゴリズムと指向的探索部を統合する。
  • SAC や DQN などのオフポリシー手法を主な学習目的に用いながら、目標に依存する方策が情報の多い状態へ探索を誘導する。

実験結果

リサーチクエスチョン

  • RQ1不変の目標に依存する方策は、非定常な報酬ボーナス手法に比べ、探索効率で優れているか?
  • RQ2不確実性推定値がノイズが多いまたは不正確な場合、報酬ボーナス手法と比較して指向的探索はどのように性能を発揮するか?
  • RQ3複雑な環境において、不確実性に基づく目標選択は、ランダムな目標サンプリングに比べて探索を改善するか?
  • RQ4目標に依存する方策の学習速度は、指向的探索全体の探索効率にどのように影響するか?
  • RQ5指向的探索は、アーキテクチャの変更なしに、既存のオフポリシー強化学習アルゴリズムにモジュラリに統合可能か?

主な発見

  • 指向的探索における不確実性に基づく目標選択は、マウンテンカーや FetchPush の両環境で、ランダムな目標サンプリングに比べて顕著に優れた性能を示した。
  • マウンテンカーにおいては、ドメインの単純さのおかげで方策が素早く学習されたにもかかわらず、指向的探索は報酬ボーナス手法よりも速やかに探索を達成した。
  • 方策学習が遅い FetchPush においても、指向的探索は報酬ボーナス手法を上回り、ノイズが多いまたは遅延のある不確実性信号に対しても安定性を示した。
  • 報酬ボーナス手法は、非定常性のため、不確実性の変化に適応するのに遅く、関数近似器を通じて不確実性信号が遅れて伝搬された。
  • 指向的探索における目標に依存する方策は、不確実性推定値が変動しても安定して効果的であり、報酬ボーナス手法とは異なり、不安定性に苦しむことはなかった。
  • 指向的探索は、不確実性測定が不正確であってもより強い耐性を示し、報酬ボーナス手法に比べて、不確実性推定の品質にあまり依存しないことが示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。