Skip to main content
QUICK REVIEW

[論文レビュー] Deep Quality-Value (DQV) Learning

Matthia Sabatelli, Gilles Louppe|arXiv (Cornell University)|Sep 30, 2018
Reinforcement Learning in Robotics参考文献 26被引用数 6
ひとこと要約

この論文は、時系列差分学習を用いて状態価値V(s)を推定する価値ネットワークを用いてQネットワークの学習を改善する、新しい深層強化学習アルゴリズムであるDeep Quality-Value(DQV)学習を提案する。DQVは4つのAtariゲームにおいて、DQNおよびDouble DQNを上回り、より速く学習し、より高い累積報酬を達成する。Pongは400エピソード未満で解決され、ベースライン手法の2倍以上速い。

ABSTRACT

We introduce a novel Deep Reinforcement Learning (DRL) algorithm called Deep Quality-Value (DQV) Learning. DQV uses temporal-difference learning to train a Value neural network and uses this network for training a second Quality-value network that learns to estimate state-action values. We first test DQV's update rules with Multilayer Perceptrons as function approximators on two classic RL problems, and then extend DQV with the use of Deep Convolutional Neural Networks, `Experience Replay' and `Target Neural Networks' for tackling four games of the Atari Arcade Learning environment. Our results show that DQV learns significantly faster and better than Deep Q-Learning and Double Deep Q-Learning, suggesting that our algorithm can potentially be a better performing synchronous temporal difference algorithm than what is currently present in DRL.

研究の動機と目的

  • 状態価値関数V(s)を推定する価値ネットワークを用いてQネットワークの学習をガイドすることで、サンプル効率と学習速度を向上させる新しい深層強化学習アルゴリズムの開発。
  • 表形式のQV(λ)アルゴリズムを深層ニューラルネットワークに拡張し、複雑で高次元の環境でも利用可能にする。
  • Atari 2600環境において、標準的なDRLコンponents(例:経験再生、ターゲットネットワーク)と組み合わせたDQVの有効性の評価。
  • 価値ネットワークを事前に学習させることで、Qネットワークの収束が早くなるかどうかを検証する。その根拠は、V関数がQ関数よりも速く収束する可能性があるという直感に基づく。
  • DQNやDouble DQNのような既存のDRLアルゴリズムに代わる、より安定的で効率的な代替手法としてのDQVの可能性の探求。

提案手法

  • DQVは、時系列差分学習を用いて状態価値V(s)を推定する価値ニューラルネットワークを訓練し、その推定値をQネットワークのターゲット値の計算に用いる。
  • Qネットワークは、推定されたV(s)を用いてターゲット値を計算する修正されたTD更新を用いて訓練される。これにより、ブートストラapping誤差が低減され、学習の安定性が向上する。
  • アルゴリズムは、遷移の時間的相関を解消し、データ効率を向上させるために経験再生を統合している。
  • 価値ネットワークのターゲット値推定をオンラインネットワークの更新から分離することで、学習を安定化させるために、ターゲットニューラルネットワークが使用されている。
  • Atari環境では、状態関数および行動価値関数の関数近似として、深層畳み込みニューラルネットワークが使用されている。
  • アルゴリズムは、主なQネットワークと、価値関数のための別個で、ゆっくりと更新されるターゲットネットワークを備えた二重ネットワークアーキテクチャを採用しており、Q学習の更新中に安定したターゲットを提供する。

実験結果

リサーチクエスチョン

  • RQ1価値ネットワークを用いることで、深層強化学習におけるQネットワークの学習安定性と速度が向上するか?
  • RQ2事前学習済みまたは収束が速い価値関数を用いることで、深層RLにおけるQネットワークの収束が速くなるか?
  • RQ3Atari 2600環境において、DQVはDQNおよびDouble DQNと比較して、学習速度と最終的パフォーマンスで優れているか?
  • RQ4経験再生とターゲットネットワークの統合が、DQVのパフォーマンスと安定性に与える影響は何か?
  • RQ5DQVフレームワークは、高次元の観測を持つ複雑な制御タスクに効果的にスケーリング可能か?

主な発見

  • DQVは、テストされた4つのAtariゲームすべてでDQNおよびDouble DQNよりも速く学習した。Pongは400エピソード未満で解決され、ベースライン手法の2倍以上速かった。
  • Boxing環境では、DQVはDQNおよびDDQNよりも約300エピソード早く、最大累積報酬約80に到達した。
  • Enduro環境では、同じ訓練期間中にDQNおよびDDQNのほぼ2倍の累積報酬を達成した。
  • Ice-Hockeyでは、800エピソード以降もDQVのみがポリシーを改善したのに対し、DQNおよびDDQNはさらなる改善を示さなかった。
  • Q学習のターゲットとして価値ネットワークを用いることで、サンプル効率と最終的パフォーマンスが顕著に向上した。これは、V関数推定がQ関数学習を加速させることの有効性を示唆している。
  • DQVは特に報酬が疎な環境において、優れた安定性と収束速度を示し、価値関数のためのターゲットネットワークを備えた二重ネットワークアーキテクチャの有効性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。