Skip to main content
QUICK REVIEW

[論文レビュー] Using Indirect Encoding of Multiple Brains to Produce Multimodal Behavior

Jacob Schrum, Joel Lehman|arXiv (Cornell University)|Apr 26, 2016
Reinforcement Learning in Robotics参考文献 16被引用数 4
ひとこと要約

本稿では、幾何的関係を仮定せずに、複数の独立したニューラルネットワーク(‘brains’)を進化させることで、マルチモーダルな行動を実現する新しい間接符号化フレームワーク、Multi-Brain HyperNEAT(MB-HyperNEAT)を紹介する。HyperNEATのスケーラブルな間接符号化と、MM-NEATのモジュラーで好みニューロンに基づく制御を組み合わせることで、進化が独立したポリシーの数とその活性化論理を同時に発見可能となり、従来の方法(例:状況的ポリシー幾何学)を上回る性能を示した。

ABSTRACT

An important challenge in neuroevolution is to evolve complex neural networks with multiple modes of behavior. Indirect encodings can potentially answer this challenge. Yet in practice, indirect encodings do not yield effective multimodal controllers. Thus, this paper introduces novel multimodal extensions to HyperNEAT, a popular indirect encoding. A previous multimodal HyperNEAT approach called situational policy geometry assumes that multiple brains benefit from being embedded within an explicit geometric space. However, experiments here illustrate that this assumption unnecessarily constrains evolution, resulting in lower performance. Specifically, this paper introduces HyperNEAT extensions for evolving many brains without assuming geometric relationships between them. The resulting Multi-Brain HyperNEAT can exploit human-specified task divisions to decide when each brain controls the agent, or can automatically discover when brains should be used, by means of preference neurons. A further extension called module mutation allows evolution to discover the number of brains, enabling multimodal behavior with even less expert knowledge. Experiments in several multimodal domains highlight that multi-brain approaches are more effective than HyperNEAT without multimodal extensions, and show that brains without a geometric relation to each other outperform situational policy geometry. The conclusion is that Multi-Brain HyperNEAT provides several promising techniques for evolving complex multimodal behavior.

研究の動機と目的

  • 制御器間の幾何的仮定に依存する既存のマルチモーダルニューロエボリューション手法の限界に対処する。これは、非幾何的行動モードへの適用性を制限する。
  • エキスパートが事前にタスクを分割するのを減らすために、進化が何時・どのように複数の独立したニューラルコントローラーを使用するかを発見可能にする。
  • 進化が最適なブレイン数を動的に決定できる「モジュール突然変異」というメカニズムを導入する。これにより、人為的介入を最小限に抑える。
  • スケーラブルでモジュラーなニューラルネットワークの進化を通じて、複雑なマルチモーダル行動をサポートする間接符号化の有効性を評価する。

提案手法

  • 複数の独立したサブストラクチャを導入し、それぞれが別個のニューラルネットワーク(‘brain’)を保持するようにHyperNEATを拡張。これにより、幾何的制約なしに大規模で複雑なネットワークを間接符号化可能となる。
  • 好みニューロンを導入し、エージェントが環境の文脈に応じてどのブレインが行動を制御するかを自律的に選択可能とすることで、人為的タスク分割の必要性を排除する。
  • モジュール突然変異を実装。これは、探索プロセス中に新しいブレインを進化可能にする遺伝的オペレータであり、最適なコントローラー数の動的発見を可能にする。
  • マルチタスクCPPNを用いて複数のブレインを同時に符号化。これにより、コントローラー間で共通する構造的規則性を維持しつつ、モジュラリティと独立性を保つ。
  • 4つのマルチモーダルドメイン(うち2つは新規)にフレームワークを適用し、タスク分割やモジュラリティの条件の変化に応じた性能を評価する。
  • MB-HyperNEATをベースラインのHyperNEAT、状況的ポリシー幾何学、およびMM-NEATの変種と比較。評価指標はフィットネススコア、ブレイン使用パターン、統計的有意性である。

実験結果

リサーチクエスチョン

  • RQ1異なるコントローラー間の幾何的関係を仮定しない間接符号化フレームワークを用いて、マルチモーダルな行動を効果的に進化させることは可能か?
  • RQ2人為的タスク分割が存在しない状況下で、好みニューロンが自律的ブレイン選択をどの程度可能にするか?
  • RQ3モジュール突然変異により、進化が最適なブレイン数を発見可能となり、固定アーキテクチャ手法を上回る性能を発揮するか?
  • RQ4タスク構造の度合いが異なるマルチモーダルドメインにおいて、MB-HyperNEATの性能は状況的ポリシー幾何学および標準的なHyperNEATと比べてどの程度優れているか?

主な発見

  • マルチタスクCPPNを用いたMulti-Brain HyperNEATは、全テストドメインで状況的ポリシー幾何学を一貫して上回った。これは、コントローラー間の幾何的制約が不要であり、むしろ有害である可能性を示唆している。
  • 好みニューロンに基づくアプローチは、ほとんどのドメインで状況的ポリシー幾何学と同等のフィットネススコアを達成したが、人為的タスク分割が存在しなかったにもかかわらず、高い適応性を示した。
  • 好みニューロンを用いたエージェントは、マルチモーダル拡張なしの標準的HyperNEATを著しく上回った。これは、複数のブレインによるマルチモーダル制御が、事前のタスク分解がなくても性能向上をもたらすことを示している。
  • 多くの不要なブレインが生成されたにもかかわらず、モジュール突然変異手法は、固定アーキテクチャの好みニューロンアプローチと同等の性能を達成した。これは、イントロン様CPPN領域が、まれな有益な突然変異を可能にする進化的レジリエンスを提供している可能性を示唆している。
  • 全ドメインの最終チャンピオンは1〜3つのブレインのみを使用しており、3つを超えるブレインはほとんど必要ないことが示された。また、適切な選択がなされていれば、ブレイン数は性能の強い決定要因ではないことがわかった。
  • 結果から、MB-HyperNEATはマルチモーダルコントローラー設計におけるエキスパート知識の必要性を低減しており、複雑な行動の進化にスケーラブルかつ汎用的なフレームワークであると示唆される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。