Skip to main content
QUICK REVIEW

[論文レビュー] Optimistic Exploration even with a Pessimistic Initialisation

Tabish Rashid, Bei Peng|arXiv (Cornell University)|Feb 26, 2020
Reinforcement Learning in Robotics参考文献 37被引用数 13
ひとこと要約

この論文では、深層強化学習における探索の効率性を保証するモデルフリーの強化学習アルゴリズムOPIQを提案する。OPIQは、カウントベースの楽観的ボーナスを懐疑的に初期化されたQ値に追加することで、楽観的ネットワーク初期化に依存せずに、保証された探索の有効性を実現する。OPIQは、アクション選択およびブートストラップの両方において楽観的であることを維持し、モンテズマのレインジューのようなスパarsely-rewarded環境で、内因的動機付けを用いたベースラインDQNを上回る性能を発揮する。

ABSTRACT

Optimistic initialisation is an effective strategy for efficient exploration in reinforcement learning (RL). In the tabular case, all provably efficient model-free algorithms rely on it. However, model-free deep RL algorithms do not use optimistic initialisation despite taking inspiration from these provably efficient tabular algorithms. In particular, in scenarios with only positive rewards, Q-values are initialised at their lowest possible values due to commonly used network initialisation schemes, a pessimistic initialisation. Merely initialising the network to output optimistic Q-values is not enough, since we cannot ensure that they remain optimistic for novel state-action pairs, which is crucial for exploration. We propose a simple count-based augmentation to pessimistically initialised Q-values that separates the source of optimism from the neural network. We show that this scheme is provably efficient in the tabular setting and extend it to the deep RL setting. Our algorithm, Optimistic Pessimistically Initialised Q-Learning (OPIQ), augments the Q-value estimates of a DQN-based agent with count-derived bonuses to ensure optimism during both action selection and bootstrapping. We show that OPIQ outperforms non-optimistic DQN variants that utilise a pseudocount-based intrinsic motivation in hard exploration tasks, and that it predicts optimistic estimates for novel state-action pairs.

研究の動機と目的

  • 保証された探索効率性を有する表計算アルゴリズムにおいて重要な役割を果たす楽観的初期化の欠如を、深層強化学習で解決すること。
  • ニューラルネットワークが懐疑的に初期化された場合でも、未知の状態行動ペアのQ値推定が楽観的であることを保証すること。
  • アクション選択およびブートストラップの両方において楽観的であることを維持する手法を開発し、高次元環境における探索の効率性を向上させること。
  • 楽観的初期化をネットワーク重みから分離することで、保証された探索効率性を持つ表計算アルゴリズムを深層強化学習に拡張すること。
  • 適切にQ学習に統合された場合、カウントベースのボーナスが未知の状態行動ペアに十分な楽観的推定を提供できることを示すこと。

提案手法

  • OPIQは、懐疑的に初期化されたQ値にカウントベースの補正を適用する:$ Q^{+}(s,a) := Q(s,a) + \frac{C}{(N(s,a)+1)^M} $、ここで$ N(s,a) $は訪問回数、$ C, M > 0 $はハイパーパramータである。
  • 補正された$ Q^{+} $-値は、アクション選択およびブートストラップの両方で使用され、学習全体を通して楽観的性が維持される。
  • この手法は、保証された探索効率性を持つ表計算Q学習アルゴリズムUCB-Hに根拠を置いているが、楽観的初期化の代わりに懐疑的初期化とカウントベースの楽観的性を採用している。
  • 深層強化学習では、OPIQは既存の状態行動カウント手法(例:擬似カウント)と統合され、高次元空間における$ N(s,a) $の推定が行われる。
  • アルゴリズムは、楽観的性の源をニューラルネットワーク重みに依存せず、代わりに楽観的性の源をネットワーク重みから分離する。
  • OPIQは標準的なDQNベースアーキテクチャと互換性があり、nステップブートストラップおよび優先順位付き経験再生を用いて適用可能である。

実験結果

リサーチクエスチョン

  • RQ1モデルフリーの深層強化学習アルゴリズムが、楽観的ネットワーク初期化に依存せずに保証された探索効率性を達成できるか?
  • RQ2アクション選択およびブートストラップの両方において楽観的性を維持することは、スパarsely-rewarded環境における探索を著しく改善するか?
  • RQ3Q値が懐疑的に初期化された場合でも、カウントベースのボーナスが未知の状態行動ペアに十分な楽観的推定を提供できるか?
  • RQ4報酬信号にボーナスのみを用いる内因的動機付け手法と比較して、OPIQはどのように異なるか?
  • RQ5ブートストラップ段階での楽観的性が、モンテズマのレインジューのような複雑な環境におけるサンプル効率性および最終的パフォーマンスをどの程度向上させるか?

主な発見

  • OPIQは、モンテズマのレインジューにおいて、擬似カウントベースの内因的動機付けを用いたDQNを著しく上回り、より高いエピソード報酬および最大エピソード報酬を達成した。
  • OPIQは1250万ステップ以内にモンテズマのレインジューで12部屋を訪問し、他のベースラインと比べて顕著に優れた探索性能を示した。
  • DQN + PCとOPIQ(楽観的ボーナスなし)の間には大きな性能差が認められ、アクション選択段階での楽観的性が探索に不可欠であることを示している。
  • 可視化結果から、OPIQの$ Q^{+} $-値が未知の状態行動ペアに対して楽観的な推定を提供していることが確認された。
  • 迷路環境では、楽観的ボーナスを有するOPIQが、擬似カウントを用いたアブレーションを含むすべての代替手法を上回り、ブートストラップ段階での楽観的性の重要性を示した。
  • 結果から、カウントベースの内因的報酬のみでは効率的な探索が不十分であることが明らかになったが、OPIQがアクション選択およびブートストラップの両方で楽観的性を活用することで、極めて有効であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。