Skip to main content
QUICK REVIEW

[論文レビュー] Diversity Actor-Critic: Sample-Aware Entropy Regularization for Sample-Efficient Exploration

Seungyul Han, Youngchul Sung|arXiv (Cornell University)|Jun 2, 2020
Reinforcement Learning in Robotics参考文献 53被引用数 10
ひとこと要約

本稿では、サンプルに適応したエントロピー正則化を用いることで、探索を向上させるサンプル効率の良い強化学習アルゴリズムであるDiversity Actor-Critic (DAC)を提案する。Jensen-Shannon発散を用いて、現在の方策とリプレイバッファの行動分布の重み付き組み合わせのエントロピーを最大化することで、高次元かつ報酬が疎な環境でも、SAC や TD3 といった最先端の手法を凌駕する性能を発揮する。

ABSTRACT

In this paper, sample-aware policy entropy regularization is proposed to enhance the conventional policy entropy regularization for better exploration. Exploiting the sample distribution obtainable from the replay buffer, the proposed sample-aware entropy regularization maximizes the entropy of the weighted sum of the policy action distribution and the sample action distribution from the replay buffer for sample-efficient exploration. A practical algorithm named diversity actor-critic (DAC) is developed by applying policy iteration to the objective function with the proposed sample-aware entropy regularization. Numerical results show that DAC significantly outperforms existing recent algorithms for reinforcement learning.

研究の動機と目的

  • リプレイバッファの情報を方策探索に組み込むことで、オフポリシー強化学習におけるサンプル効率を向上させること。
  • 従来の方策エントロピー正則化の限界、すなわちリプレイバッファ内の歴史的サンプル分布を無視することを是正すること。
  • リプレイバッファの行動分布を明示的に計算することなく、探索を向上させる実用的なアルゴリズムを開発すること。
  • 報酬が疎または高次元な行動空間を持つ挑戦的な連続制御タスクで優れた性能を達成すること。
  • 方策エントロピーとリプレイベースの行動分布の多様性を共同で最適化することで、より効果的な探索が実現されることを示すこと。

提案手法

  • 現在の方策の行動分布とリプレイバッファの行動分布の重み付き和のエントロピーを最大化する、サンプルに適応したエントロピー正則化を提案する。
  • 方策とリプレイバッファの行動分布の乖離度を測るために、Jensen-Shannon 発散(D_JS^α)を代理指標として用い、効率的な最適化を可能にする。
  • 訓練中に方策エントロピーとリプレイ分布への整合性のバランスを動的に調整するため、適応的温度パラメータ α を導入する。
  • 提案された目的関数にポリシー反復を適用することで、リプレイ分布の明示的計算を避ける実用的なオフポリシー手法 DAC を開発する。
  • 過去の軌道を保存するリプレイバッファを用い、バッファ内の行動の経験的分布を歴史的探索パターンの代理として用いる。
  • ソフトアクタクリティックフレームワークを改変し、サンプルに適応した正則化をアクタークリティック更新プロセスに統合する。

実験結果

リサーチクエスチョン

  • RQ1リプレイバッファからの歴史的サンプル分布を組み込むことで、オフポリシー強化学習における探索が向上するか?
  • RQ2サンプルに適応したエントロピー正則化は、標準的な方策エントロピー正則化と比較して、より高いサンプル効率と最終的性能を達成するか?
  • RQ3方策エントロピーとリプレイベースの行動多様性の共同最適化は、高次元制御タスクにおける学習の安定性と収束性にどのように影響するか?
  • RQ4DAC は報酬が疎な環境において、SAC や TD3 といった既存のオフポリシー手法をどの程度上回るか?
  • RQ5適応的温度パラメータ α は、DAC における探索と活用のバランスにどのような影響を及ぼすか?

主な発見

  • DAC は、報酬が疎で高次元な行動空間を持つすべての評価済み MuJoCo 環境において、SAC や他の最近のアルゴリズムを顕著に上回る性能を発揮した。
  • HumanoidStandup-v1 環境では、DAC が最大平均報酬 197,302.37 ± 43,055.31 を達成し、SAC (58,693.87 ± 12,269.93) や PPO (160,211.90 ± 3,268.37) を上回った。
  • DelayedHalfCheetah-v1 タスクでは、DAC が 7,594.70 ± 1,259.23 を達成し、SAC (4,639.85 ± 1,393.95) や PPO (2,247.92 ± 640.69) を上回った。
  • アブレーションスタディの結果、DAC の性能はエントロピー係数 β や制御係数 c の値に強く依存せず、c = -2.0·dim(A) の設定で最適な結果が得られた。
  • Jensen-Shannon 発散を用いることで、KL 発散や JS 発散のみを用いるSACの変種と比較して顕著な性能向上が得られた。これは、共同正則化アプローチの有効性を示している。
  • DelayedHopper-v1、DelayedWalker2d-v1、DelayedAnt-v1 といったすべてのテスト環境において、DAC は一貫したサンプル効率の向上と最終報酬の向上を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。