Skip to main content
QUICK REVIEW

[論文レビュー] Non-local Policy Optimization via Diversity-regularized Collaborative Exploration

Zhenghao Peng, Hao Sun|arXiv (Cornell University)|Jun 14, 2020
Reinforcement Learning in Robotics参考文献 38被引用数 5
ひとこと要約

本稿では、非局所的ポリシー最適化フレームワークであるDiversity-regularized Collaborative Exploration (DiCE)を提案する。DiCEは、多様性を正則化するメカニズムを用いて、異種のエージェントのチームが協働的に状態-行動空間を探索する。MuJoCoの歩行環境において、PPOおよびSACのベースラインと比較して、サンプル効率と最終的なパフォーマンスが顕著に向上し、Ant-v3では最大2.3倍、Humanoid-v3では1.8倍の報酬を達成した。

ABSTRACT

Conventional Reinforcement Learning (RL) algorithms usually have one single agent learning to solve the task independently. As a result, the agent can only explore a limited part of the state-action space while the learned behavior is highly correlated to the agent's previous experience, making the training prone to a local minimum. In this work, we empower RL with the capability of teamwork and propose a novel non-local policy optimization framework called Diversity-regularized Collaborative Exploration (DiCE). DiCE utilizes a group of heterogeneous agents to explore the environment simultaneously and share the collected experiences. A regularization mechanism is further designed to maintain the diversity of the team and modulate the exploration. We implement the framework in both on-policy and off-policy settings and the experimental results show that DiCE can achieve substantial improvement over the baselines in the MuJoCo locomotion tasks.

研究の動機と目的

  • 単一エージェント強化学習における局所的探索の限界、すなわちエージェントが自身のポリシーと経験に制約されることを是正すること。
  • 経験を共有する異種エージェントのチームを活用して、状態-行動空間の異なる領域を探索する非局所的探索を可能にすること。
  • 同時に訓練する中でエージェント間の行動的多様性を維持し、類似した劣悪なポリシーへの収束を防ぐこと。
  • 高コストなオートエンコーダーや手作業で設計された特徴量を避ける、効率的でコンactな多様性正則化メカニズムを設計すること。
  • 挑戦的なMuJoCoの歩行タスクにおいて、オンポリシーおよびオフポリシーの両設定でフレームワークを検証すること。

提案手法

  • DiCEは、環境と独立に相互作用する異種エージェントのグループを採用し、収集した経験を共有する。
  • 集中型リプレイバッファが共有された経験を保存し、すべてのエージェントが同じデータプールから学習できるようにする。
  • 実行可能方向法に基づく多様性正則化メカニズムが、ポリシー更新を調整してエージェント間の行動的多様性を保持する。
  • コンパクトな多様性価値ネットワーク(DVN)が多様性値を推定し、オートエンコーダーや手作業特徴量の必要性を回避する。
  • 訓練の安定化のため、Two-side Clip Loss、正規化されたアドバンテージ、遅延ターゲット更新を統合する。
  • DiCEは、A2CやPPOなどのオンポリシー、SACなどのオフポリシーアルゴリズムに実装され、主要な構成要素に関するアブレーションスタディが実施された。

実験結果

リサーチクエスチョン

  • RQ1異種エージェントによる協働的探索は、局所的最小値を越えて有効な探索空間を著しく拡大できるか?
  • RQ2学習可能なコンパクトな多様性正則化メカニズムは、連続制御タスクにおけるサンプル効率と最終パフォーマンスを向上させるか?
  • RQ3チームサイズは、DiCEにおける協働的探索のパフォーマンスと安定性にどのように影響するか?
  • RQ4DiCEはMuJoCoの歩行環境において、PPO や SAC といった標準ベースラインをどの程度上回るか?
  • RQ5個々の構成要素(例:DVN、正規化、多様性正則化)は、DiCE全体のパフォーマンスにどの程度寄与しているか?

主な発見

  • Ant-v3では、DiCEが平均報酬2517.65を達成し、オンポリシー設定でPPOベースライン(1230.82)およびSAC(4825.35)を上回った。
  • Humanoid-v3では、DiCEが平均報酬566.88を達成し、オンポリシー設定でPPO(453.09)に対して16%の改善、オフポリシー設定でSAC(5046.93)に対して12%の改善を達成した。
  • 最適なチームサイズはK=7であった。K=10では、多様性が過剰になりすぎてポリシー品質が低下した。
  • アブレーションスタディの結果、協働的探索を無効化(w/o CE)すると訓練が崩壊し、アドバンテージの正規化を削除すると性能が著しく低下した。
  • 多様性価値ネットワーク(DVN)は、Ant-v3では不安定な多様性信号のためパフォーマンスを悪化させたが、Walker2d-v3では影響が小さく、タスク依存の感受性が示された。
  • DiCE-SACは別個の多様性コーチを備えており、Walker2d-v3で4784.59の報酬を達成し、標準SAC(4293.26)を上回った。これにより、本手法の強靭性と一般化能力が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。