Skip to main content
QUICK REVIEW

[論文レビュー] Qgraph-bounded Q-learning: Stabilizing Model-Free Off-Policy Deep Reinforcement Learning

Sabrina Hoppe, Marc Toussaint|arXiv (Cornell University)|Jul 15, 2020
Reinforcement Learning in Robotics被引用数 5
ひとこと要約

本稿では、replayメモリの遷移から部分グラフ(Qグラフ)を構築し、Q反復を用いて正確な下界Q値を計算することにより、モデルフリーのオフポリシー深層強化学習を安定化するQgraph-bounded Q-learningを提案する。時系列差分学習においてこれらの境界を強制することで、ソフト発散を防ぎ、サンプル効率を向上させるとともに、連続的制御タスクにおけるハイパーパramータや限られたreplayメモリ容量に対するロバスト性が向上する。

ABSTRACT

In state of the art model-free off-policy deep reinforcement learning, a replay memory is used to store past experience and derive all network updates. Even if both state and action spaces are continuous, the replay memory only holds a finite number of transitions. We represent these transitions in a data graph and link its structure to soft divergence. By selecting a subgraph with a favorable structure, we construct a simplified Markov Decision Process for which exact Q-values can be computed efficiently as more data comes in. The subgraph and its associated Q-values can be represented as a QGraph. We show that the Q-value for each transition in the simplified MDP is a lower bound of the Q-value for the same transition in the original continuous Q-learning problem. By using these lower bounds in temporal difference learning, our method QG-DDPG is less prone to soft divergence and exhibits increased sample efficiency while being more robust to hyperparameters. QGraphs also retain information from transitions that have already been overwritten in the replay memory, which can decrease the algorithm's sensitivity to the replay memory capacity.

研究の動機と目的

  • モデルフリーのオフポリシー深層強化学習におけるソフト発散を解消すること、特に連続的制御タスクに焦点を当てる。
  • 不安定性や発散に寄与するreplayメモリの構造的性質を分析すること。
  • 部分グラフ構造を活用して、正確で保守的なQ値の下界を計算する手法を開発することにより、学習の安定性を向上させること。
  • 上書きされた遷移からの情報を保持することで、replayメモリ容量への感受性を低減すること。
  • DDPGベースのアルゴリズムにおけるサンプル効率とハイパーパramータ選択へのロバスト性を向上させること。

提案手法

  • replayメモリを、ノードが状態で、エッジが(状態、行動、報酬、次状態)の遷移であるデータグラフとして表現する。
  • 「ぶら下がりエッジ」(後続の遷移のない非終端状態)を除外し、ゼロ行動を含めることで、このような状態を統合する部分グラフ(Qグラフ)を構築する。
  • Q反復を用いてQグラフの正確なQ値を計算し、元のMDPのQ値に対する保証された下界を持つ有限MDPを形成する。
  • これらの下界を時系列差分学習のターゲットとして用いることで、Q学習の更新を安定化させ、ソフト発散を防止する。
  • DDPGにQグラフを統合し、ポリシーおよび価値ネットワークの更新時に下界Q値を組み込んだTDターゲットを修正する。
  • 非決定的遷移に対しては、帰還の偏差が有界であると仮定することで、不確実性にもかかわらず性能を維持する。

実験結果

リサーチクエスチョン

  • RQ1replayメモリのデータグラフにおけるどの構造的パターンが、オフポリシー深層RLにおけるソフト発散に関連しているか?
  • RQ2replay遷移の部分グラフを構築することで、正確なQ値を効率的に計算し、全体のMDPの下界として利用できるか?
  • RQ3TD学習においてこれらの下界Q値を強制することで、連続的制御タスクにおけるソフト発散が軽減され、学習の安定性が向上するか?
  • RQ4Qグラフはどの程度、サンプル効率とハイパーパramータ設定へのロバスト性を向上させるか?
  • RQ5Qグラフは、replayバッファで上書きされた遷移からの有用な情報を保持できるか?

主な発見

  • Qグラフ手法、QG-DDPGは、replay遷移の部分グラフから導出される保守的Q値下界を強制することで、連続的制御タスクにおけるソフト発散を防止する。
  • QG-DDPGは、通常のDDPGよりも高いサンプル効率を達成し、特に不利なハイパーパramータ設定下でも顕著である。
  • replayバッファにたった1,000件の遷移しか保持できない状況でも、無制限のメモリを使用する通常のDDPGと同等の性能を示し、メモリ容量制限に対するロバスト性を示している。
  • 遷移の非決定性が増加しても、この手法は依然として有効であり、理論的仮定である決定性の仮定に反しても耐性を示す。
  • Qグラフは、上書きされた遷移からの情報を暗黙的に保持することで、replayバッファサイズへの感受性を低減する。
  • Qグラフからの下界は、一般の下界よりも情報量が多く、現在のポリシーで訪問されやすい状態における過小評価を是正する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。