Skip to main content
QUICK REVIEW

[論文レビュー] Neural Architecture Evolution in Deep Reinforcement Learning for Continuous Control

Jörg K. H. Franke, Gregor Köhler|arXiv (Cornell University)|Oct 28, 2019
Reinforcement Learning in Robotics参考文献 21被引用数 4
ひとこと要約

この論文は、新しい知識蒸留ベースの変異演算子を用いて、連続的制御タスクにおけるニューラルネットワークのアーキテクチャと方策を同時に進化させる、Actor-Critic Neuroevolution (ACN) を提案する。オフポリシーの深層強化学習と神経進化を組み合わせることで、ACN は、しばしば手作業で設計されたものよりも小さく、より効果的な、高い性能を発揮する、サンプル効率の良いアーキテクチャを発見する。固定アーキテクチャでの標準的な訓練に比べて、計算コストの増加はわずかである。

ABSTRACT

Current Deep Reinforcement Learning algorithms still heavily rely on handcrafted neural network architectures. We propose a novel approach to automatically find strong topologies for continuous control tasks while only adding a minor overhead in terms of interactions in the environment. To achieve this, we combine Neuroevolution techniques with off-policy training and propose a novel architecture mutation operator. Experiments on five continuous control benchmarks show that the proposed Actor-Critic Neuroevolution algorithm often outperforms the strong Actor-Critic baseline and is capable of automatically finding topologies in a sample-efficient manner which would otherwise have to be found by expensive architecture search.

研究の動機と目的

  • 連続的制御タスクにおける深層強化学習が、手作業で設計されたニューラルネットワークアーキテクチャに依存することを是正すること。
  • 事前学習や後処理の検索ではなく、訓練中にオンラインで、サンプル効率の良いアーキテクチャ探索を可能にすること。
  • 深刻な忘却や性能の崩壊を引き起こさない安定な遺伝的演算子を、ネットワークトポロジーの進化に用いること。
  • 共有のグローバルリプレイバッファを用いて、神経進化とオフポリシーのアクター・クリティック学習を統合すること。
  • 進化したアーキテクチャが、追加の環境インタラクションを最小限に抑えながら、固定アーキテクチャを上回るか同等の性能を発揮できることを実証すること。

提案手法

  • ACN は、個体群のアクターおよびクリティックネットワークを、それぞれ異なるトポロジーとパラメータで進化させる遺伝的アルゴリズムを用いる。
  • 新しい知識蒸留ベースの変異演算子が、ネットワークトポロジーを拡大し、その後、グローバルリプレイバッファからサンプリングされた状態に対して、MSE損失を用いて親から子への知識転送を実行する。
  • 変異プロセスは、まず層やノードを追加することで容量を増加させ、次に親ネットワークからの知識蒸留によって性能を安定化させる。
  • TD3 を用いたオフポリシー学習が、個体群内の全個体に適用され、グローバルリプレイバッファを共有することで、サンプル効率を向上させる。
  • トーナメント選択により、環境インタラクションからの累積報酬(フィットネス)に基づいて、次世代の親が選ばれる。
  • この手法は、ポリシーまたは価値関数を再初期化せずに、訓練中にネットワークトポロジーを変更できるオンラインアーキテクチャ進化をサポートする。

実験結果

リサーチクエスチョン

  • RQ1連続的制御タスクにおける深層強化学習の訓練中に、ニューラルネットワークアーキテクチャをオンラインで進化させることは可能か?
  • RQ2知識蒸留ベースの変異演算子は、アクター・クリティックネットワークのトポロジー変更中に性能を安定化させることができるか?
  • RQ3進化したアーキテクチャは、追加の環境インタラクションを最小限に抑えながら、手作業で設計されたアーキテクチャを上回るか同等の性能を発揮できるか?
  • RQ4神経進化とオフポリシーRLの統合は、サンプル効率および最終的な性能にどのように影響を与えるか?
  • RQ5異なる連続的制御環境で、どのようなアーキテクチャ的パターンが出現するのか?それらは、既知の最適設計と一致するか?

主な発見

  • ACN は、HalfCheetah、Ant、Walker2d、Humanoid、Hopper の5つの連続的制御ベンチマークすべてにおいて、固定アーキテクチャを用いたTD3と同等または優れた性能を発揮する。
  • Humanoidでは、アーキテクチャとパrameter空間における探索的性質のおかげで、顕著な性能向上が得られた。
  • ACN が発見した最良のアーキテクチャは、通常、デフォルトのTD3アーキテクチャよりも小さい。例えば、HalfCheetahでは [80, 80, 88] が、TD3の [600, 450] よりも小さく、依然として優れたまたは同等の性能を発揮する。
  • Antでは、276ユニットの単一層アーキテクチャが発見され、TD3のデフォルトの半分のサイズであったが、性能は同等であった。
  • 共有のリプレイバッファと進化したアーキテクチャのおかげで、合計の環境インタラクション回数が削減され、計算コストの増加はわずかであった。
  • 実験により、ACN が訓練中に最適化子とターゲットネットワークを再初期化しても、性能に悪影響を及ぼさず、むしろ向上させる可能性があることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。