Skip to main content
QUICK REVIEW

[論文レビュー] An Information-Theoretic Optimality Principle for Deep Reinforcement Learning

Felix Leibfried, Jordi Grau-Moya|arXiv (Cornell University)|Aug 6, 2017
Reinforcement Learning in Robotics参考文献 50被引用数 16
ひとこと要約

本稿では、情報理論的罰則信号を導入することでQ値の過大評価を低減する、深層強化学習における情報理論的最適性原理を提案する。動的スケジューリングによりラグランジュ乗数を制御することで、DQN、ダブルDQN、ソフトQ学習よりも優れたサンプル効率と性能を達成し、アタリゲームにおいて標準的およびデュエルネットワークアーキテクチャの両方で妥当性が確認された。

ABSTRACT

We methodologically address the problem of Q-value overestimation in deep reinforcement learning to handle high-dimensional state spaces efficiently. By adapting concepts from information theory, we introduce an intrinsic penalty signal encouraging reduced Q-value estimates. The resultant algorithm encompasses a wide range of learning outcomes containing deep Q-networks as a special case. Different learning outcomes can be demonstrated by tuning a Lagrange multiplier accordingly. We furthermore propose a novel scheduling scheme for this Lagrange multiplier to ensure efficient and robust learning. In experiments on Atari, our algorithm outperforms other algorithms (e.g. deep and double deep Q-networks) in terms of both game-play performance and sample complexity. These results remain valid under the recently proposed dueling architecture.

研究の動機と目的

  • 高次元状態空間におけるサンプル効率の低下を引き起こすQ値の過大評価を是正すること。
  • 元来表状強化学習で用いられていた情報理論的原則を、連続的かつ高次元の環境における深層関数近似器に適応すること。
  • 調整可能なハイパーパrameterを用いてDQNを特別なケースとして含む統一的最適化フレームワークを構築すること。
  • 内在的罰則信号の動的スケジューリングにより、サンプル効率と最終的な性能を深層RLで向上させること。
  • デュエルアーキテクチャを含め、多様なアタリ環境においてこの手法を検証すること。

提案手法

  • 現在の方策と基準方策の乖離に基づく情報理論的罰則を組み込んだ、新規の最適化目的関数を導入する。
  • ラグランジュ乗数を用いて内在的罰則の強度を制御し、DQNからより保守的なQ値推定まで多様な学習行動を実現する。
  • 時間的ベルマン誤差の進化に基づき、探索と安定性のバランスを取るためにラグランジュ乗数の動的スケジューリング手法を採用する。
  • 深層Qネットワーク(DQN)およびデュエルアーキテクチャにこの手法を適用し、環境間で一貫した性能向上を実現する。
  • 値の優位性を用いて罰則信号を堅牢に計算することで、学習の安定性を向上させる。
  • エピソード報酬に指数平滑化を適用し、学習曲線の明確な可視化と比較を可能にする。

実験結果

リサーチクエスチョン

  • RQ1高次元強化学習における深層関数近似器に、情報理論的原則を効果的に適応することでQ値の過大評価を低減できるか?
  • RQ2方策乖離に基づく動的罰則信号を導入することで、深層RLにおけるサンプル効率と最終的性能が向上するか?
  • RQ3調整可能なラグランジュ乗数を用いて、DQNと他のQ学習変種を統一的最適化フレームワークに統合できるか?
  • RQ4ダブルDQNやソフトQ学習といった最先端ベースラインと比較して、この手法はゲーム性能とサンプル複雑性の面でどのように差をつけるか?
  • RQ5デュエルアーキテクチャは、提示された情報理論的罰則と組み合わせることで、さらに性能を向上させるか?

主な発見

  • 本手法(DIN:Dynamic Information-theoretic Network)は、20種類のアタリゲームにおける中央値正規化スコアでDQNおよびダブルDQNを上回り、性能とサンプル効率の両面で顕著な改善を示した。
  • ロードランナーモードでは、DINが約2×10⁷回の訓練イテレーションでピーク性能に到達したが、ダブルDQNは3×10⁷、標準DQNは5×10⁷であった(通常アーキテクチャを使用)。
  • ラグランジュ乗数λの事前チューニングを必要とせず、ソフトQ学習(SQL)を上回る性能を達成し、ロードランナーでは約500万イテレーションでSQLの最良結果を上回った。
  • DINが生成したQ値推定は、DQNおよびダブルDQNと比較して一貫して低く抑えられており、過大評価バイアスが低減されていることが確認された。
  • デュエルアーキテクチャと組み合わせることで、DINの性能がさらに向上し、現代の深層RLアーキテクチャと高い互換性と相乗効果を示した。
  • ラグランジュ乗数の動的スケジューリングにより、滑らかな学習曲線と高速な収束を実現し、より安定的かつ効率的な学習が達成された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。