Skip to main content
QUICK REVIEW

[論文レビュー] Dropout Q-Functions for Doubly Efficient Reinforcement Learning

T. HIRAOKA, Takahisa Imagawa|arXiv (Cornell University)|Oct 5, 2021
Reinforcement Learning in Robotics参考文献 39被引用数 19
ひとこと要約

本論文は、層正則化を施したドロップアウトQ関数の小規模アンサンブルを用いる計算効率の良いREDQの変種、DroQを提案する。単純であるがゆえに、DroQはREDQと同等のサンプル効率を達成し、REDQの2倍以上の計算効率を実現し、サンプル効率ではSACを上回りながら、速度はSACと同等を維持する。

ABSTRACT

Randomized ensembled double Q-learning (REDQ) (Chen et al., 2021b) has recently achieved state-of-the-art sample efficiency on continuous-action reinforcement learning benchmarks. This superior sample efficiency is made possible by using a large Q-function ensemble. However, REDQ is much less computationally efficient than non-ensemble counterparts such as Soft Actor-Critic (SAC) (Haarnoja et al., 2018a). To make REDQ more computationally efficient, we propose a method of improving computational efficiency called DroQ, which is a variant of REDQ that uses a small ensemble of dropout Q-functions. Our dropout Q-functions are simple Q-functions equipped with dropout connection and layer normalization. Despite its simplicity of implementation, our experimental results indicate that DroQ is doubly (sample and computationally) efficient. It achieved comparable sample efficiency with REDQ, much better computational efficiency than REDQ, and comparable computational efficiency with that of SAC.

研究の動機と目的

  • サンプル効率は高いが、大規模なQ関数アンサンブルを用いるため計算に非効率なREDQの問題を解決する。
  • 連続的制御強化学習において、サンプル効率を損なわず計算効率を向上させる。
  • 高UTD比設定において、ドロップアウトがアンサンブル手法の有効な代替手段であるかどうかを検証する。
  • 特にドロップアウトと層正則化といった工学的実践が、高UTD比強化学習におけるバイアス低減とサンプル効率向上にどのように寄与するかを調査する。
  • 最小限のアーキテクチャ的変更(ドロップアウト+正則化)によって、二重に効率的な強化学習手法を実現できることを示す。

提案手法

  • ドロップアウトと層正則化を組み合わせた小規模アンサンブル(M=2)を用いるREDQの変種、DroQを提案する。
  • Qネットワークの順伝播時にドロップアウトを適用し、REDQが用いる独立なネットワークの完全なアンサンブルに代わる確率的アンサンブルを生成する。
  • Qネットワークの各全結合層に層正則化を統合し、訓練の安定性と一般化性能を向上させる。
  • ポリシーとQ関数の更新に、M=2のインターセットミニマム化を適用し、REDQとSACと同様の手法を採用する。
  • ポリシーの学習には、2つのドロップアウトQ関数の最小値を用い、Q値の正則化された推定値とする。
  • 既存のSACまたはREDQのコードベースにドロップアウトと層正則化レイヤーを追加するだけで実装可能であり、シンプルさと再現可能性を確保する。

実験結果

リサーチクエスチョン

  • RQ1ドロップアウトベースのQ関数の小規模アンサンブルは、REDQの大きなアンサンブルと同等のサンプル効率を達成できるか?
  • RQ2ドロップアウトと層正則化の組み合わせは、高UTD比強化学習におけるバイアス低減とサンプル効率向上に寄与するか?
  • RQ3ドロップアウトベースのQ関数は、SACと同等の計算効率を達成しつつ、REDQを上回る速度を実現できるか?
  • RQ4ドロップアウトを高UTD強化学習で効果的に使用する上で、重要な工学的実践(例:正則化、アンサンブルサイズ)は何か?
  • RQ5高UTD強化学習設定において、ドロップアウトは完全なアンサンブルの代替手段として実用的か?

主な発見

  • DroQはMuJoCoベンチマーク全体でREDQと同等のサンプル効率を達成し、平均報酬がREDQと同等またはそれを上回る。
  • DroQは1回の更新あたりの計算時間をREDQの2倍以上短縮し、元のREDQよりも顕著に高速化されている。
  • DroQはSACと同等の計算効率を達成しており、更新あたりのウォールクロックタイムがSACと同等である一方、サンプル効率でSACを上回っている。
  • アブレーションスタディの結果、ドロップアウトとアンサンブル平均化(M=2)および層正則化の組み合わせがバイアス低減とパフォーマンス向上に不可欠であることが確認された。
  • 層正則化は訓練の安定性とパフォーマンスを顕著に向上させ、同じ設定でバッチ正則化やグループ正則化を上回った。
  • 本手法は非常に実用的である:DroQはSACまたはREDQの実装にドロップアウトと層正則化レイヤーを数行追加するだけで実装可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。