Skip to main content
QUICK REVIEW

[論文レビュー] Structured Control Nets for Deep Reinforcement Learning

Mario Srouji, Jian Zhang|arXiv (Cornell University)|Feb 22, 2018
Reinforcement Learning in Robotics参考文献 23被引用数 6
ひとこと要約

この論文は、ポリシーを非線形制御モジュールと線形制御モジュールに分離する新しい深層強化学習ポリシー・アーキテクチャ、構造的制御ネットワーク(SCN)を提案する。グローバルな非線形制御とローカルな線形安定化を組み合わせることで、サンプル効率、最終エピソード報酬、一般化性能が向上し、PPO、ES、ACKTRを用いたMuJoCo、Roboschool、Atari、2次元ドライブ環境において、より小さなネットワークで競争力ある性能を達成する。

ABSTRACT

In recent years, Deep Reinforcement Learning has made impressive advances in solving several important benchmark problems for sequential decision making. Many control applications use a generic multilayer perceptron (MLP) for non-vision parts of the policy network. In this work, we propose a new neural network architecture for the policy network representation that is simple yet effective. The proposed Structured Control Net (SCN) splits the generic MLP into two separate sub-modules: a nonlinear control module and a linear control module. Intuitively, the nonlinear control is for forward-looking and global control, while the linear control stabilizes the local dynamics around the residual of global control. We hypothesize that this will bring together the benefits of both linear and nonlinear policies: improve training sample efficiency, final episodic reward, and generalization of learned policy, while requiring a smaller network and being generally applicable to different training methods. We validated our hypothesis with competitive results on simulations from OpenAI MuJoCo, Roboschool, Atari, and a custom 2D urban driving environment, with various ablation and generalization tests, trained with multiple black-box and policy gradient training methods. The proposed architecture has the potential to improve upon broader control tasks by incorporating problem specific priors into the architecture. As a case study, we demonstrate much improved performance for locomotion tasks by emulating the biological central pattern generators (CPGs) as the nonlinear part of the architecture.

研究の動機と目的

  • 制御タスクにおける深層強化学習のサンプル効率、最終エピソード報酬、一般化性能の向上。
  • 標準のMLPポリシーと比較して性能を維持または向上させながら、ネットワークサイズの削減。
  • 中央パターン生成器(CPGs)のようなタスク固有のインダクティブバイアスをポリシーネットワークアーキテクチャに統合することの検討。
  • ブラックボックスおよびポリシー勾配アプローチを含む、多様な環境と訓練手法におけるアーキテクチャの妥当性の検証。
  • 線形および非線形制御の利点を組み合わせることで、構造的ポリシーネットワークが一般のMLPを上回ることの実証。

提案手法

  • SCNはポリシーネットワークを2つの並列ストリーム(非線形制御モジュールと線形制御モジュール)に分解する。
  • 最終的な行動は両モジュール出力の和として計算される:$ a = u^n + u^l $。
  • 非線形モジュールは、グローバルかつ前向きの制御をモデル化するため、小さなMLP(例:8ユニット)として実装される。
  • 線形モジュールは、非線形出力の残差まわりの局所的ダイナミクスを安定化させ、耐障害性を向上させる。
  • 歩行タスクでは、非線形モジュールがCPGにインspiredされたフーリエ級数に置き換えられる:$ u^n_t = \sum_{i=1}^{16} A_i \sin(\omega_i t + \phi_i) $。
  • アーキテクチャは、PPO、ES、ACKTRなど、複数の訓練手法と互換性があり、アーキテクチャの変更なしに利用可能である。

実験結果

リサーチクエスチョン

  • RQ1ポリシーを非線形および線形コンponentに分割することで、深層強化学習におけるサンプル効率と最終的性能が向上するか?
  • RQ2SCNアーキテクチャは、MuJoCo、Roboschool、Atari、2次元ドライブシミュレータを含む多様な制御環境に一般化可能か?
  • RQ3CPGのようなタスク固有のインダクティブバイアスを、非線形モジュールに効果的に組み込むことができるか、特に歩行タスクでの性能向上に寄与するか?
  • RQ4標準のMLPベースラインと比較して、顕著に小さいネットワークサイズでもSCNアーキテクチャは性能を維持できるか?
  • RQ5ポリシー勾配およびブラックボックス最適化手法を含む、異なる訓練アルゴリズムにおいてSCNはどのように性能を発揮するか?

主な発見

  • SCN-8は、60種類のAtariゲームにおいて、より大きなMLP-512ベースラインと同等またはそれ以上の平均および最終エピソード報酬を達成し、ネットワークサイズを93%も削減した。
  • 2次元都市ドライブ環境では、SCNは一般化性能および最終的性能においてMLPベースラインを上回り、特に分布シフト下でも顕著に優れた性能を示した。
  • MuJoCoおよびRoboschoolの歩行タスクでは、CPG構造を備えたSCN(ロコモーター・ネット)が、標準のMLPよりも高い最終報酬と高速な学習を達成した。
  • わずか4個の隠れユニットを持つ場合でも、SCN-4は多くのAtariゲームでMLP-8の性能を同等または上回り、高いサンプル効率を示した。
  • アブレーションスタディの結果、非線形モジュールおよび線形モジュールの両方が不可欠であることが確認され、いずれかを削除すると性能が低下した。
  • SCNアーキテクチャは、アーキテクチャチューニングなしに、ES、PPO、ACKTRを含む多様な環境および訓練手法において一般化性能を向上させた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。