Skip to main content
QUICK REVIEW

[論文レビュー] Investigating Recurrence and Eligibility Traces in Deep Q-Networks

Jean Harb, Doina Precup|arXiv (Cornell University)|Apr 18, 2017
Reinforcement Learning in Robotics参考文献 13被引用数 6
ひとこと要約

この論文は、アタリ環境における強化学習のための深層Qネットワーク(DQN)において、有効性トレースと再帰的ニューラルネットワーク(RNN)の統合を調査する。RNNと有効性トレースを組み合わせることで、特に報酬が疎であり部分的に観測可能なゲーム(Pong や Tennis など)において、学習の安定性とサンプル効率が顕著に向上することを示している。Adam最適化は収束を加速させ、RMSpropを上回る性能を発揮する。

ABSTRACT

Eligibility traces in reinforcement learning are used as a bias-variance trade-off and can often speed up training time by propagating knowledge back over time-steps in a single update. We investigate the use of eligibility traces in combination with recurrent networks in the Atari domain. We illustrate the benefits of both recurrent nets and eligibility traces in some Atari games, and highlight also the importance of the optimization used in the training.

研究の動機と目的

  • 有効性トレースを再帰的ネットワークと組み合わせた深層強化学習における有効性を調査すること。
  • RMSprop や Adam などの最適化アルゴリズムが、RNNベースのDQNにおける学習パフォーマンスに与える影響を評価すること。
  • アタリゲームのような部分的に観測可能で報酬が疎な環境における課題に対処すること。
  • 有効性トレースが再帰的DQNアーキテクチャにおける学習の安定化と収束加速に寄与するかどうかを特定すること。
  • 複数のアタリゲームにおいて、有効性トレースを有するか無しのRNNベースのエージェントのパフォーマンスを比較すること。

提案手法

  • 過去の観測に必要な記憶と文脈を提供する再帰的ニューラルネットワーク(RNN)を用い、部分的に観測可能な環境におけるより良い信用配分を実現する。
  • TD誤差を複数の時間ステップにわたり伝搬するため、有効性トレース(λ=0.8)を適用し、時間的信用配分を改善する。
  • Q(λ)学習を採用し、nステップリターンとλによる指数的重み付けを組み合わせることでバイアスと分散のバランスを取る。
  • 経験再生と確率的勾配降下法を用い、RMSprop および Adam 最適化手法でエージェントを訓練する。
  • 理論的根拠として有効性トレースの前方視点を用いるが、実装上は後方視点を採用する。
  • 特に Pong と Tennis を対象とし、テストスコアと収束速度を測定することで、アタリ2600ゲームでのパフォーマンスを評価する。

実験結果

リサーチクエスチョン

  • RQ1DQNにおいて再帰的ネットワークと組み合わせた有効性トレースが、学習パフォーマンスに与える影響は何か?
  • RQ2RMSprop と Adam といった異なる最適化アルゴリズムが、RNNベースのDQNの訓練の安定性と収束速度に与える影響は何か?
  • RQ3有効性トレースを備えたRNNは、Tennis や Pong のような報酬が疎な環境で、標準DQNの限界を克服できるか?
  • RQ4なぜDQNエージェントはTennisで最適方策を学習できないのか?また、有効性トレースを備えたRNNはこの問題をどのように解決するか?
  • RQ5学習率と最適化手法の選択が、再帰的DQNモデルにおける有効性トレースの有効性に与える影響は何か?

主な発見

  • Adamで学習したRNNに有効性トレースを適用したモデルは、13エポックでTennisで準最適スコアに到達し、標準DQNおよびトレースなしのRNNを上回った。
  • RMSprop と学習率0.00025を用いた場合、トレースなしのRNNは45エポックでスコア20に到達したが、トレースありのモデルは62エポックを要し、収束が遅い傾向にあった。
  • RMSprop を用い、学習率を0.001に引き上げた場合、トレースありのRNNは27エポックで20点に到達したが、トレースなしのモデルは0点の閾値を下回った。
  • Adam最適化により、有効性トレースを備えたRNNはわずか13エポックで最適パフォーマンスに到達し、顕著な加速効果が示された。
  • 有効性トレースなしのモデルは不安定を示し、勝利するよう学習した後、しばしば劣悪な「遅延」方策に戻ることがあったが、トレースありのモデルは安定したままであった。
  • 標準DQNはTennisでスコア0を上回れず、報酬の遅延と疎らさのため、単にボールの入れ替えに終始するループに陥っていた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。