Skip to main content
QUICK REVIEW

[論文レビュー] Using a Logarithmic Mapping to Enable Lower Discount Factors in Reinforcement Learning

Harm van Seijen, Mehdi Fatemi|arXiv (Cornell University)|Jun 3, 2019
Reinforcement Learning in Robotics参考文献 18被引用数 9
ひとこと要約

本論文は、Q値推定値を対数空間にマップすることで、状態空間全体にわたる行動ギャップを均一化し、深層強化学習における低割引因子の有効な使用を可能にするLogDQNを提案する。行動ギャップのサイズの分散を低減することで、特にγ = 0.96の条件下で、報酬が疎なタスク(例:Atariゲーム)において、標準DQNや既存のベースラインを上回る性能を達成する。

ABSTRACT

In an effort to better understand the different ways in which the discount factor affects the optimization process in reinforcement learning, we designed a set of experiments to study each effect in isolation. Our analysis reveals that the common perception that poor performance of low discount factors is caused by (too) small action-gaps requires revision. We propose an alternative hypothesis that identifies the size-difference of the action-gap across the state-space as the primary cause. We then introduce a new method that enables more homogeneous action-gaps by mapping value estimates to a logarithmic space. We prove convergence for this method under standard assumptions and demonstrate empirically that it indeed enables lower discount factors for approximate reinforcement-learning methods. This in turn allows tackling a class of reinforcement-learning problems that are challenging to solve with traditional methods.

研究の動機と目的

  • 低割引因子が有限ホライズンの目的関数において理論的に優位であるにもかかわらず、近似強化学習ではなぜしばしば性能が劣るのかを調査すること。
  • 関数近似設定における低割引因子を用いた場合の性能劣化の根本的要因を同定すること。
  • 状態空間全体にわたる行動ギャップのサイズを均一化することで、低割引因子を有効に活用できる手法を開発すること。
  • 標準的な強化学習の仮定の下で、提案手法の収束を証明すること。
  • 提案手法が、困難で報酬が疎な環境において優れた性能を発揮することを実験的に検証すること。

提案手法

  • 行動ギャップのサイズの差の大きさを低減するために、学習可能な変換を用いてQ値推定値を対数空間にマップする。
  • 二重ヘッドアーキテクチャを採用:正のQ値用と負のQ値用のヘッドを別々に設け、初期化値を異なるものにすることで安定性を維持する。
  • 更新則は、変換された値のL2損失を最小化する対数空間における時系列差分学習を適用する。
  • 学習可能なスケーリング係数cと対数正則化項を用いて、学習の安定性を高め、発散を防止する。
  • 標準的な仮定(報酬の有界性、関数近似)の下で、手法の収束を証明している。
  • DQNに統合し、ストキャスティックなAtari環境(スタック付きアクションあり)を用いて評価した。

実験結果

リサーチクエスチョン

  • RQ1なぜ低割引因子は有限ホライズンの目的関数において理論的に優位であるにもかかわらず、近似強化学習では通常失敗するのか?
  • RQ2関数近似を用いた場合に低割引因子を用いることで性能が劣化する主な要因は何か?
  • RQ3価値関数空間の変換により、不均一な行動ギャップの悪影響を軽減できるか?
  • RQ4対数空間での学習により、低割引因子を用いた安定的かつ効果的な訓練が可能になるか?
  • RQ5提案手法は、Atariゲームのような報酬が疎な環境で、標準DQNや既存のベースラインを上回る性能を発揮できるか?

主な発見

  • LogDQNは55種類のAtariゲームで人間正規化平均スコア106.5%を達成し、DQNや他のベースラインを著しく上回った。
  • 本手法により、γ = 0.96の低割引因子の有効な使用が可能となり、DQNベースラインのγ = 0.99よりも優れた性能を示した。
  • 55種類のAtariゲームにおいて、48ゲームでDQNを上回り、そのうち15ゲームで50%以上の性能向上を達成した。
  • LogDQNの中央値人間正規化スコアは100.5%であり、ゲーム群全体にわたる強力な全体的性能を示した。
  • 実験結果は、性能劣化の主な要因が行動ギャップの大きさの分散(行動ギャップの大きさそのものではない)であるという仮説を支持した。
  • 標準的な仮定の下で収束を示したため、実験的成功の理論的根拠が得られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。