Skip to main content
QUICK REVIEW

[論文レビュー] Hybrid Actor-Critic Reinforcement Learning in Parameterized Action Space

Fan Zhou, Rui Su|arXiv (Cornell University)|Mar 4, 2019
Reinforcement Learning in Robotics参考文献 17被引用数 9
ひとこと要約

本論文は、複数の並列なサブアクター・ネットワークを用いて離散的および連続的アクション成分を統合的に処理する、パrameterized action spaceを対象としたハイブリッド・アクター・クリティック強化学習アーキテクチャを提案する。この手法は、共有のグローバル・クリティックによって制御され、Hybrid Proximal Policy Optimization (H-PPO) と名付けられている。H-PPOは、DQN や P-DQN といった先行手法と比較して、4つのベンチマークタスクにおいてより優れた性能を示し、収束が速く、成功確率が高く、ばらつきが小さい。

ABSTRACT

In this paper we propose a hybrid architecture of actor-critic algorithms for reinforcement learning in parameterized action space, which consists of multiple parallel sub-actor networks to decompose the structured action space into simpler action spaces along with a critic network to guide the training of all sub-actor networks. While this paper is mainly focused on parameterized action space, the proposed architecture, which we call hybrid actor-critic, can be extended for more general action spaces which has a hierarchical structure. We present an instance of the hybrid actor-critic architecture based on proximal policy optimization (PPO), which we refer to as hybrid proximal policy optimization (H-PPO). Our experiments test H-PPO on a collection of tasks with parameterized action space, where H-PPO demonstrates superior performance over previous methods of parameterized action reinforcement learning.

研究の動機と目的

  • パrameterized action space における強化学習エージェントの訓練という課題に取り組む。ここでのアクションは、離散的選択と連続的パラメータの組み合わせから成る。
  • 標準的なディープRLアルゴリズムが十分に処理できない複雑なアクション空間における、サンプル効率と学習安定性の向上を図る。
  • パrameterized action space を超えて一般の階層的アクション構造へも拡張可能な柔軟なアーキテクチャの設計を目的とする。
  • PPOに基づく実装(H-PPO)を開発し、複数の並列アクター間で共有されるクリティックの監視を活用して、政策学習の協調性を高める。

提案手法

  • アーキテクチャは、階層的アクション空間の特定のコンponent(離散的アクション選択と連続的パラメータ選択)を担当する複数の並列サブアクター・ネットワークを採用する。
  • 単一のグローバル・クリティック・ネットワークが状態-アクションペアを評価し、すべてのサブアクター・ネットワークに一様な価値信号を同時に提供する。
  • クリティックは共有価値関数を用いてアドバンテージ推定値を計算し、統一された目的関数を通じてすべてのサブアクターにおける一貫性のある政策更新を可能にする。
  • 本手法は H-PPO として具体化され、訓練の安定化を図るため PPO のクリッピング機構を適用しながら、離散的および連続的ポリシー・ヘッド間の協調性を維持する。
  • サブアクター間で初期層を共有することで特徴の共有を促進し、一般化性能の向上を図る一方で、離散的および連続的アクションのための別個のポリシー・ヘッドを許容する。
  • 訓練プロセスは、サブアクターのポリシー更新とクリティックの価値関数更新を交互に実行し、両方のコンponentをバランスさせる統一された損失関数を用いる。

実験結果

リサーチクエスチョン

  • RQ1並列サブアクターとグローバル・クリティックを備えたハイブリッド・アクター・クリティック・アーキテクチャは、パrameterized action space における学習安定性と性能を向上させることができるか?
  • RQ2H-PPO は、多様なタスクにおいて、標準的な DQN や P-DQN と比較して、成功確率、収束速度、ばらつきの観点でどのように異なるか?
  • RQ3このハイブリッド・アーキテクチャは、パrameterized action 以外の階層的アクション空間構造へどの程度一般化可能か?
  • RQ4複数のサブアクター間で共有されるクリティックの監視は、より協調的かつ効果的なポリシー学習をもたらすか?

主な発見

  • 『Moving』環境では、H-PPO は 90.45% ± 6.75% の成功確率を達成し、P-DQN(1.56% ± 2.78%)および DQN(0.00%)を著しく上回った。
  • 『Chase and Attack』環境では、H-PPO は 99.98% ± 0.30% の成功確率を達成し、最も低いばらつきを示し、DQN(99.91% ± 0.74%)および P-DQN(99.85% ± 0.84%)を上回った。
  • 『Half Field Football』タスクでは、H-PPO は 95.39% ± 4.81% の成功確率を達成し、P-DQN(76.31% ± 16.81%)および DQN(0.00%)を上回った。
  • H-PPO は、すべての4つの環境において収束が早く、より安定した学習曲線を示し、ベースライン手法と比較して性能のばらつきが小さかった。
  • H-PPO は、すべての環境で DQN や P-DQN よりも高い平均エピソード報酬を達成し、『Half Field Football』では最高報酬 9.849 を記録した。
  • 定性的な分析から、H-PPO は、たとえば TURN や DASH や KICK といった離散的アクションと、角度、パワー、方向といった適切な連続的パラメータを適切に連携して学習していることが示された。これは、『Half Field Football』におけるフレームごとの行動例から明らかになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。