Skip to main content
QUICK REVIEW

[論文レビュー] Striving for Simplicity and Performance in Off-Policy DRL: Output Normalization and Non-Uniform Sampling

Che Wang, Yanqiu Wu|arXiv (Cornell University)|Oct 5, 2019
Power Line Communications and Noise参考文献 51被引用数 13
ひとこと要約

この論文は、エントロピー最大化を用いず、MuJoCoの連続的制御ベンチマークで最先端のサンプル効率を達成する、簡素化されたオフポリシー深層強化学習アルゴリズム、Streamlined Off-Policy with Emphasizing Recent Experience (SOP+ERE) を提案する。SACのエントロピー正則化を出力正規化または逆方向勾配に置き換え、最近の経験に重点を置く単純な非一様サンプリング方式(ERE)を組み合わせることで、100万サンプルでAntとHumanoidの両環境でSACを21%および24%上回る性能を達成する。

ABSTRACT

We aim to develop off-policy DRL algorithms that not only exceed state-of-the-art performance but are also simple and minimalistic. For standard continuous control benchmarks, Soft Actor-Critic (SAC), which employs entropy maximization, currently provides state-of-the-art performance. We first demonstrate that the entropy term in SAC addresses action saturation due to the bounded nature of the action spaces, with this insight, we propose a streamlined algorithm with a simple normalization scheme or with inverted gradients. We show that both approaches can match SAC's sample efficiency performance without the need of entropy maximization, we then propose a simple non-uniform sampling method for selecting transitions from the replay buffer during training. Extensive experimental results demonstrate that our proposed sampling scheme leads to state of the art sample efficiency on challenging continuous control tasks. We combine all of our findings into one simple algorithm, which we call Streamlined Off Policy with Emphasizing Recent Experience, for which we provide robust public-domain code.

研究の動機と目的

  • SACのような最先端のオフポリシーDRLアルゴリズムにおけるエントロピー最大化の真の役割を、連続的制御タスクにおいて理解すること。
  • エントロピー最大化の複雑さを回避する、最小限で高性能なオフポリシーDRLアルゴリズムを開発すること。
  • 単純な非一様リプレイバッファサンプリング戦略により、サンプル効率を向上させること。
  • 再現可能性と実用的利用を可能にする、堅牢で公開可能な実装を提供すること。

提案手法

  • 出力正規化を提案し、有界な行動空間における行動飽和を防ぐ。これにより、SACにおけるエントロピー正則化の必要性が不要になる。
  • 目的関数を変更せずに探索を維持できる代替手法として、逆方向勾配(IG)を導入する。
  • 最近の遷移のサンプリング確率を向上させる軽量な非一様サンプリング手法である「最近の経験の強調(ERE)」を開発する。複雑なデータ構造を必要としない。
  • 簡素化された方策更新とEREサンプリングを組み合わせ、学習効率を向上させるSOP+EREアルゴリズムを構築する。
  • 二重Qネットワーク、ターゲットネットワーク、経験リプレイを用いた標準的なオフポリシー学習を採用するが、サンプリングおよび方策出力メカニズムを変更する。
  • 勾配更新をQネットワークと方策に使用する単純な学習ループを採用し、固定されたターゲット更新レートと標準的な経験リプレイバッファを使用する。

実験結果

リサーチクエスチョン

  • RQ1SACにおけるエントロピー項がMuJoCoの連続的制御タスクにおいて果たす主な機能的役割は何か?
  • RQ2エントロピー最大化を用いず、SACと同等のサンプル効率を達成できる最小限のオフポリシーDRLアルゴリズムは開発可能か?
  • RQ3単純な非一様サンプリング戦略(最近の経験に重点を置く)は、一様サンプリングやPERと比較して、サンプル効率にどの程度優れるか?
  • RQ4出力正規化と最近の経験の強調を組み合わせることで、SACを困難なMuJoCo環境で上回ることができるか?

主な発見

  • SACにおけるエントロピー項の主な役割は、有界な行動空間に起因する行動飽和を緩和することであり、探索そのものではない。
  • 出力正規化と逆方向勾配のみで、エントロピー最大化を用いず、MuJoCoベンチマークでSACと同等のサンプル効率と頑健性を達成できる。
  • 提案されたEREサンプリング手法は、サンプル効率を顕著に向上させ、単純さとパフォーマンスの両面で一様サンプリングおよびPERを上回る。
  • SOP+EREは、100万サンプルでAntとHumanoid環境において、SACを21%および24%上回るサンプル効率を達成する。
  • SOP+EREは、複雑さを抑えつつ、困難な連続的制御タスクで最先端のパフォーマンスを達成する。
  • この手法は頑健で、公開可能であり、再現性と実用的デプロイメントを可能にする。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。