Skip to main content
QUICK REVIEW

[論文レビュー] Efficient exploration with Double Uncertain Value Networks

Thomas M. Moerland, Joost Broekens|arXiv (Cornell University)|Nov 29, 2017
Reinforcement Learning in Robotics参考文献 33被引用数 14
ひとこと要約

本稿では、ベイジアンドロップアウトとベルマン方程式に沿ったガウス分布の伝播を用いて、限られたデータからのパrametric uncertainty(パrametric不確実性)と確率的リターンからのリターン不確実性(return uncertainty)を同時にモデル化する、深層強化学習手法であるダブル不確実値ネットワーク(DUVN)を提案する。両方の不確実性を統合し、探索にトンプソンサンプリングを用いることで、挑戦的な探索環境における学習効率が著しく向上し、チェーン領域では標準的な$\epsilon$-greedy法や非指向的探索手法を上回り、標準的なGym環境でも同等またはそれ以上の性能を示した。

ABSTRACT

This paper studies directed exploration for reinforcement learning agents by tracking uncertainty about the value of each available action. We identify two sources of uncertainty that are relevant for exploration. The first originates from limited data (parametric uncertainty), while the second originates from the distribution of the returns (return uncertainty). We identify methods to learn these distributions with deep neural networks, where we estimate parametric uncertainty with Bayesian drop-out, while return uncertainty is propagated through the Bellman equation as a Gaussian distribution. Then, we identify that both can be jointly estimated in one network, which we call the Double Uncertain Value Network. The policy is directly derived from the learned distributions based on Thompson sampling. Experimental results show that both types of uncertainty may vastly improve learning in domains with a strong exploration challenge.

研究の動機と目的

  • 限られたデータからのパrametric不確実性と、確率的リターンからのリターン不確実性という2つの異なる不確実性源をモデル化することで、強化学習における探索と活用のトレードオフを改善すること。
  • 両方の不確実性を同時に推定できる深層ニューラルネットワークアーキテクチャを構築すること。
  • 両方の不確実性を統合することで、$\epsilon$-greedy やボルツマン探索といった非指向的探索手法よりも、より効率的な探索が可能になることを実証すること。
  • ベイジアンドロップアウトとガウス出力分布を用いることで、既存の深層Qネットワークに最小限の変更を加えるだけで本手法を実装できることを示すこと。
  • 高難易度の探索環境、例えばチェーン領域や標準的なOpenAI Gym環境において、本手法の有効性を検証すること。

提案手法

  • テスト時におけるドロップアウトを用いたベイジアンニューラルネットワークにより、パrametric不確実性をモデル化し、事後予測分布の近似を実現する。
  • ベルマン更新式に沿ってガウス分布を伝播させることで、状態行動ペアからのリターンの分布をモデル化し、リターン不確実性を表現する。
  • 両方の不確実性を統合した1つの深層ニューラルネットワークとして、ダブル不確実値ネットワーク(DUVN)を構築し、値推定の平均と分散の両方を出力する。
  • 学習済みの分布に基づいてトンプソンサンプリングを用い、不確実性に基づいた原理的な探索が可能な方策を直接導出する。
  • 標準的な深層Qネットワークを変更することでDUVNを実装:ベイジアン推論用にドロップアウト層を追加し、平均のみの出力をガウス分布出力に置き換える。
  • 標準的な深層RLアルゴリズムを用いてネットワークを学習させ、パrametric不確実性とリターン不確実性の両方を考慮した損失関数を用いる。

実験結果

リサーチクエスチョン

  • RQ11つの深層ネットワーク内でパrametric不確実性とリターン不確実性の両方をモデル化することで、強化学習における探索効率が向上するか?
  • RQ2非指向的探索手法(例:$\epsilon$-greedy)と比較して、不確実性源の統合的モデル化は、サンプル効率や最終的なパフォーマンスにおいてどのように差をつけるか?
  • RQ3本手法は、チェーン領域のような高難易度の探索環境において、既存の手法を著しく上回る性能を示せるか?
  • RQ4DUVNフレームワークは、標準的な深層Qネットワーク実装と互換性があり、最小限のアーキテクチャ変更で実装可能か?
  • RQ5ベイジアンドロップアウトとガウスベルマン伝播の組み合わせは、単独で用いる場合よりも、より頑健で効果的な探索を実現できるか?

主な発見

  • チェーン領域、すなわち非常に挑戦的な探索環境において、DUVNは$\epsilon$-greedy法や非指向的探索手法を著しく上回った。
  • 標準的なOpenAI Gym環境においても、DUVNは非指向的探索手法と同等またはそれ以上のパフォーマンスを示し、多様なドメインにわたり一貫した改善効果を示した。
  • 本手法は、未試行の行動(高いパrametric不確実性)と劣悪な行動(低い不確実性)を効果的に区別でき、より知的で効率的な探索を可能にした。
  • ベイジアンドロップアウトによるパrametric不確実性の推定と、ガウス分布伝播によるリターン不確実性の推定を組み合わせることで、1つのニューラルネットワーク内で高精度かつ高容量の不確実性推定が可能になった。
  • 統合された不確実性分布に基づくトンプソンサンプリングにより、ヒューリスティックな探索ボーナスを必要とせず、自然に探索と活用のバランスが取れた方策が得られた。
  • DUVNの実装は、ドロップアウト層の追加とガウス出力ヘッドへの置き換えという、既存の深層Qネットワークへの最小限の変更で実現可能であり、現在のRLパイプラインへの容易な統合が可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。