Skip to main content
QUICK REVIEW

[論文レビュー] Action Branching Architectures for Deep Reinforcement Learning

Arash Tavakoli, Fabio Pardo|arXiv (Cornell University)|Nov 24, 2017
Reinforcement Learning in Robotics被引用数 6
ひとこと要約

本論文は、各行動次元ごとに個別のネットワークブランチで方策または価値関数の表現を分割しながらも、中央の意思決定モジュールを共有する行動分岐ニューラルアーキテクチャを提案する。これにより、離散的深層強化学習の高次元行動空間へのスケーリングが効率的に行える。この手法は行動次元に比例してネットワーク出力が線形に増加し、6.5×10²⁵の組み合わせ的行動空間を扱うタスクでDDPGを上回る性能を達成する。

ABSTRACT

Discrete-action algorithms have been central to numerous recent successes of deep reinforcement learning. However, applying these algorithms to high-dimensional action tasks requires tackling the combinatorial increase of the number of possible actions with the number of action dimensions. This problem is further exacerbated for continuous-action tasks that require fine control of actions via discretization. In this paper, we propose a novel neural architecture featuring a shared decision module followed by several network branches, one for each action dimension. This approach achieves a linear increase of the number of network outputs with the number of degrees of freedom by allowing a level of independence for each individual action dimension. To illustrate the approach, we present a novel agent, called Branching Dueling Q-Network (BDQ), as a branching variant of the Dueling Double Deep Q-Network (Dueling DDQN). We evaluate the performance of our agent on a set of challenging continuous control tasks. The empirical results show that the proposed agent scales gracefully to environments with increasing action dimensionality and indicate the significance of the shared decision module in coordination of the distributed action branches. Furthermore, we show that the proposed agent performs competitively against a state-of-the-art continuous control algorithm, Deep Deterministic Policy Gradient (DDPG).

研究の動機と目的

  • 離散的行動における深層強化学習の行動空間の組み合わせ的爆発を解消し、高次元タスクへのスケーラビリティを向上させること。
  • 連続的行動を離散化した場合に生じる大規模な離散的行動空間の探索の非実行可能性を、構造的なニューラルアーキテクチャによって克服すること。
  • Dueling DQNのようなサンプル効率が高く、オフポリシーな離散的アルゴリズムを、高次元行動空間を有する連続制御ドメインで利用可能にする。
  • 独立した行動ブランチを統合的に制御するための共有意思決定モジュールの役割を、非定常性や協調性の欠如による方策の崩壊を防ぐ観点から調査すること。
  • 行動分岐が、従来の離散的アルゴリズムでは扱えないと考えられていた行動空間へスケーリング可能であることを実証すること。

提案手法

  • 共有の特徴エンコーダに続く、各行動次元ごとに独立したブランチを持つニューラルアーキテクチャを提案する。
  • 各ブランチ内でドゥーリングネットワーク構造を用い、状態価値とアドバンテージを独立して推定することで、価値関数の近似を改善する。
  • 行動ブランチを統合的に制御するための共有意思決定モジュールを導入し、暗黙の協調を可能にする。
  • BDQにおけるガウス分布探索戦略を採用し、固定標準偏差σ=0.2を用いて、連続環境における継続的探索を促進する。
  • サンプル効率と学習安定性を向上させるために、βを段階的に減少させる優先順位付き経験再生を採用する。α=0.6を用いる。
  • Adam最適化法、ReLU活性化関数、Xavier重み初期化、勾配クリッピング(L2ノルム≤10)を用い、1000ステップごとにターゲットネットワークを更新する。

実験結果

リサーチクエスチョン

  • RQ1行動次元の制御を分岐ネットワークで分離するニューラルアーキテクチャが、高次元離散的または連続的行動空間において効率的な学習を可能にするか?
  • RQ2共有意思決定モジュールを含めることで、行動次元ごとに完全に独立したネットワークと比較して性能にどのような影響を与えるか?
  • RQ3Dueling DQNのような離散的行動深層強化学習アルゴリズムが、行動分岐によって、組み合わせ的に大きな行動空間へどの程度スケーリング可能か?
  • RQ4提案されたアーキテクチャが、高次元制御タスクにおいて、最先端の連続制御アルゴリズム(DDPG)を上回るか?
  • RQ5ガウス分布探索(Gaussian)とε-greedy探索の違いが、提案された分岐フレームワークにおける性能に与える影響はいかほどか?

主な発見

  • 分岐Dueling Qネットワーク(BDQ)は、約6.5×10²⁵のタプルを含む離散化された行動空間を持つ環境へも成功裏にスケーリング可能であり、従来の離散的アルゴリズムでは扱えないと考えられていた領域をカバーした。
  • BDQはベンチマークスイートにおける最も挑戦的な連続制御タスクで、Deep Deterministic Policy Gradient(DDPG)アルゴリズムを上回った。
  • 共有意思決定モジュールを欠如させた独立Dueling Qネットワーク(IDQ)は、行動次元が増加するにつれて急速に性能が低下し、ブランチ間の協調性の欠如が顕著に現れた。
  • 共有意思決定モジュールは性能に不可欠であり、IDQの失敗は非定常性と協調性の欠如による独立ネットワークのリスクを示している。
  • BDQにおけるガウス探索(σ=0.2)はε-greedy方策よりも優れた性能を示し、物理的制御ドメインでは連続的探索がより効果的である可能性を示唆している。
  • このアーキテクチャにより、行動次元に比例してネットワーク出力が線形に増加するようになり、従来の離散的行動手法で見られる組み合わせ的爆発を回避できた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。