Skip to main content
QUICK REVIEW

[論文レビュー] Deep Residual Reinforcement Learning

Shangtong Zhang, Wendelin Boehmer|arXiv (Cornell University)|May 3, 2019
Reinforcement Learning in Robotics参考文献 51被引用数 7
ひとこと要約

本稿では、残差強化学習(RL)アルゴリズムの安定化を図るため、双方向ターゲットネットワーク技術を導入している。この手法は、モデルフリーおよびモデルベースRLの両方において顕著な性能向上を実現する。実験では、残差アルゴリズムがDeepMind Control SuiteにおいてヴァナイルDDPGを上回ることを示しており、TD(k)と比較して分布マッチング問題をより効果的に解決する。特に、kステップの予測を必要とせず、1ステップのロールアウトのみで十分である点が特徴である。

ABSTRACT

We revisit residual algorithms in both model-free and model-based reinforcement learning settings. We propose the bidirectional target network technique to stabilize residual algorithms, yielding a residual version of DDPG that significantly outperforms vanilla DDPG in the DeepMind Control Suite benchmark. Moreover, we find the residual algorithm an effective approach to the distribution mismatch problem in model-based planning. Compared with the existing TD($k$) method, our residual-based method makes weaker assumptions about the model and yields a greater performance boost.

研究の動機と目的

  • 半勾配法を用いた深層RLアルゴリズムにおける不安定性と理論的保証の欠如を解消すること。
  • 新規な双方向ターゲットネットワーク技術を導入することで、深層RLにおける残差アルゴリズムの安定化を図ること。
  • モデルベース計画における分布マッチング問題を効果的に軽減できる残差アルゴリズムの有効性を実証すること。
  • 残差アルゴリズムが、TD(k)と比較してモデルベース計画において優れた性能を示す実証的証拠を提供すること。

提案手法

  • 価値関数と残差勾配の両方のターゲットネットワークを維持することで、残差学習の安定化を図る双方向ターゲットネットワーク技術を提案する。
  • DDPGに残差アルゴリズムを統合し、サンプル効率と性能を向上させる残差版(Bi-Res-DDPG)を構築する。
  • 半勾配と残差勾配の更新を組み合わせるための混合係数ηを用い、非線形関数近似下でも安定した学習を可能にする。
  • 1ステップロールアウトを用いて、実遷移と仮想遷移の両方の価値関数を学習させることで、モデルベース計画に残差アルゴリズムを適用する。
  • TD(k)損失を変更し、実遷移の重みを強化し、平均二乗誤差の代わりにHuber損失を用いることで安定性を向上させる。
  • 学習済みモデルが仮想遷移を生成するDynaスタイルの計画フレームワークを採用する。

実験結果

リサーチクエスチョン

  • RQ1新規なターゲットネットワーク設計により、深層RLにおける残差アルゴリズムを安定化させることができるか?
  • RQ2提案された残差DDPGは、連続的制御ベンチマークにおいてヴァナイルDDPGを上回る性能を示すか?
  • RQ3正確なkステップ分のモデルロールアウトが不要な状況でも、残差アルゴリズムはモデルベース計画における分布マッチング問題を効果的に解決できるか?
  • RQ4サンプル効率および最終報酬の観点から、残差ベース計画はTD(k)ベース計画と比較してどの程度優れているか?

主な発見

  • η=0.05のBi-Res-DDPGは、28のDMControlタスクにおいて、ヴァナイルDDPGと比較して顕著に高い報酬を達成しており、評価曲線から一貫した改善が観察された。
  • 双方向ターゲットネットワーク技術により、残差学習が安定化され、単純なターゲットネットワークと残差アルゴリズムの組み合わせでは失敗する状況でも安定した学習が可能になった。
  • 1ステップロールアウトのみで十分な性能を示すため、残差ベース計画はTD(k)ベース計画を多くのモデルベースRLタスクで上回った。一方、TD(k)は正確なkステップ予測を必要としていた。
  • Huber損失と改善された損失定式化を採用した修正版MVE-DDPGは、HopperやWalker環境において、先行ベースラインと比較してより高い安定性と性能を発揮した。
  • 残差アルゴリズムは、仮想状態への価値関数の一般化を効果的に行い、長時間にわたるモデルの正確性に依存せずに分布マッチングを低減した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。