Skip to main content
QUICK REVIEW

[論文レビュー] Successor Uncertainties: Exploration and Uncertainty in Temporal Difference Learning

David M. Janz, Jiri Hron|arXiv (Cornell University)|Oct 15, 2018
Reinforcement Learning in Robotics参考文献 32被引用数 9
ひとこと要約

本稿では、Successor Uncertainties (SU) を導入し、Posterior Sampling for Reinforcement Learning (PSRL) の探索的利点を維持しながら、ニューラルネットワークによる関数近似を効率的に行える、新しいモデルフリー強化学習アルゴリズムを提案する。SU はスパarsely-rewarded なテーブル型環境で最先端の性能を達成し、49個の Atari 2600 ゲームのうち38個で人間の性能を上回り、Bootstrapped DQN や Uncertainty Bellman Equation といった先行手法を凌駕する。

ABSTRACT

Posterior sampling for reinforcement learning (PSRL) is an effective method for balancing exploration and exploitation in reinforcement learning. Randomised value functions (RVF) can be viewed as a promising approach to scaling PSRL. However, we show that most contemporary algorithms combining RVF with neural network function approximation do not possess the properties which make PSRL effective, and provably fail in sparse reward problems. Moreover, we find that propagation of uncertainty, a property of PSRL previously thought important for exploration, does not preclude this failure. We use these insights to design Successor Uncertainties (SU), a cheap and easy to implement RVF algorithm that retains key properties of PSRL. SU is highly effective on hard tabular exploration benchmarks. Furthermore, on the Atari 2600 domain, it surpasses human performance on 38 of 49 games tested (achieving a median human normalised score of 2.09), and outperforms its closest RVF competitor, Bootstrapped DQN, on 36 of those.

研究の動機と目的

  • 既存のランダム化価値関数 (RVF) 法が、ニューラルネットワークと組み合わせた際のPSRLの重要な性質を失うためのスケーリング失敗を解消すること。
  • 事後サンプリングにおける効果的な探索に、不確実性の伝播が必要または十分であるかを調査すること。
  • 理論的・実験的両面でPSRLの強みを維持する、シンプルで効率的かつスケーラブルなRVFアルゴリズムを設計すること。
  • SUの有効性を、困難なテーブル型探索ベンチマークおよびAtari 2600環境において示すこと。

提案手法

  • SU は、不確実性をモデル化するために後退特徴量の事後分布を用いる。これにより、事後サンプリングによる効果的な探索が可能になる。
  • 不確実性が価値関数を通じて学習された重み分布を介して伝播される、パラメータ化された後退特徴モデルを導入する。
  • ニューラルネットワークを用いて、後退特徴量とその不確実性を同時に予測する。パラメータに対しては、別個の事前分布と尤度関数を設定する。
  • 主な革新点として、重み分布の共分散行列を徐々に減衰させる手法を採用し、学習の安定化と不確実性推定の維持を図る。
  • SU は、近似事後分布から重みをサンプリングし、特徴量とサンプルされた重みの線形結合によりQ値を計算することで、事後サンプリングを適用する。
  • 標準的なディープQネットワークのアーキテクチャを用い、共有された特徴量と、報酬およびQ値予測のための別々のヘッドを備えることで、エンドツーエンドの学習を可能にする。

実験結果

リサーチクエスチョン

  • RQ1ニューラルネットワークと事後サンプリングを組み合わせた既存のRVF手法は、PSRLの有効性をもたらす理論的性質を保持しているか?
  • RQ2事後サンプリングRLにおける効果的な探索に、不確実性の伝播は必要条件か、十分条件か?
  • RQ3PSRLの探索効率を関数近似設定でも維持できる、シンプルでスケーラブルなRVFアルゴリズムを設計できるか?
  • RQ4スパarsely-rewarded 環境において、SU は Bootstrapped DQN や Uncertainty Bellman Equation といった最先端の探索アルゴリズムを上回るか?

主な発見

  • SU は、困難なテーブル型探索ベンチマークで最先端の性能を達成し、優れたサンプル効率と頑健性を示した。
  • Atari 2600 環境では、49ゲーム中38ゲームで人間の性能を上回り、中央値のヒューマン正規化スコアは2.09を達成した。
  • Atari 49ゲーム中36ゲームで、Bootstrapped DQN を上回った。これは、深層RL設定下での探索におけるSUの優位性を裏付けた。
  • 本稿では、事後サンプリングにおける効果的な探索に、不確実性の伝播が理論的にも必要でも十分でもないことを証明した。これは、先行仮定に疑問を呈するものである。
  • SU は大規模問題に対しても高い性能を維持したが、ワンホット状態符号化の制限により、実験はL ≤ 160のチェーン問題に限定された。
  • 6つのAtariゲームにおけるハイパーパrameterチューニングにより、最適な設定が特定された。具体的には、学習率5×10⁻⁵、バッチサイズ32、重み共分散の減衰係数1−10⁻⁵が最適であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。