Skip to main content
QUICK REVIEW

[論文レビュー] Meta-Learning through Hebbian Plasticity in Random Networks

Elias Najarro, Sebastian Risi|arXiv (Cornell University)|Jul 6, 2020
Advanced Memory and Neural Computing参考文献 58被引用数 22
ひとこと要約

本論文では、報酬を明示的に用いないまま、生涯にわたり適応可能なランダム初期化されたニューラルネットワークに対して、シナプス固有のヘブ型可塑性ルールをメタラーニングで進化させる手法を提案する。この手法により、視覚ベースのタスクや3次元歩行タスクにおいて、急速かつ堅牢に性能を発揮する。たとえば、訓練中に見られなかった損傷を受ける四足歩行ロボットのナビゲーションなど、100ステップ未満で適応が達成される。重みは局所的でヘブ型の学習ルールに従い、重み空間における高性能なアトラクタに収束するように自己組織化される。

ABSTRACT

Lifelong learning and adaptability are two defining aspects of biological agents. Modern reinforcement learning (RL) approaches have shown significant progress in solving complex tasks, however once training is concluded, the found solutions are typically static and incapable of adapting to new information or perturbations. While it is still not completely understood how biological brains learn and adapt so efficiently from experience, it is believed that synaptic plasticity plays a prominent role in this process. Inspired by this biological mechanism, we propose a search method that, instead of optimizing the weight parameters of neural networks directly, only searches for synapse-specific Hebbian learning rules that allow the network to continuously self-organize its weights during the lifetime of the agent. We demonstrate our approach on several reinforcement learning tasks with different sensory modalities and more than 450K trainable plasticity parameters. We find that starting from completely random weights, the discovered Hebbian rules enable an agent to navigate a dynamical 2D-pixel environment; likewise they allow a simulated 3D quadrupedal robot to learn how to walk while adapting to morphological damage not seen during training and in the absence of any explicit reward or error signal in less than 100 timesteps. Code is available at https://github.com/enajx/HebbianMetaLearning.

研究の動機と目的

  • 報酬なしで、ヘブ型可塑性ルールのみを用いて、人工エージェントにおける生涯的適応を可能にするメタラーニングフレームワークの開発。
  • ランダム初期化されたネットワークが、進化した局所的学習ルールを通じて、複雑な強化学習タスクで高い性能を達成できるかの調査。
  • ヘブ型可塑性が、明示的な報酬信号なしに、予期しない形態的損傷に迅速に適応できることの実証。
  • 強化学習において、ネットワーク重みではなく、可塑性ルールを主な学習可能なコンponentとする可能性の探求。
  • 静的で事前学習済みの重みが性能に不可欠であるという仮定に挑戦し、神経科学にインspiredされた学習の新しい研究方向性を提示。

提案手法

  • 神経進化的手法を用いて、接続固有のヘブ型学習ルールを進化させ、強化学習タスクにおけるパフォーマンス最適化を実施。
  • ネットワークは一様分布 U[-0.1, 0.1] からのランダム重みで初期化され、事前学習や微調整は一切行わない。
  • 可塑性ルールは、局所的な事前および事後のシナプス活動の相関に基づき、原則として Δw ∝ pre × post に従う。
  • 学習ルールはエージェントの運用中、継続的に適用され、エージェントの生涯にわたり動的重み更新が可能となる。
  • 複数のランダム初期化およびタスクインスタンスにわたる可塑性ルールの最適化に、微分可能進化戦略を用いる。
  • パフォーマンスは、視覚ベース制御(CarRacing)および3次元四足歩行タスクの両方で評価され、訓練中に見られなかった形態的損傷も含む。

実験結果

リサーチクエスチョン

  • RQ1ランダムネットワークで進化したヘブ型可塑性ルールは、複雑な強化学習タスクにおいて、報酬なしで迅速に適応可能か?
  • RQ2このようなネットワークは、一般化性能および形態的損傷に対する耐性において、固定重みネットワークを上回るか?
  • RQ3ヘブ型ルールによる自己組織化は、重み空間における安定的で高性能なアトラクタへの収束をもたらすか?
  • RQ4重みの大部分がゼロにされた場合、進化したヘブ型ネットワークのパフォーマンスはどれほど頑健か?
  • RQ5局所的でバックプロパゲーションを伴わない可塑性メカニズムは、複雑な制御タスクにおいて勾配ベース手法と同等の性能を達成できるか?

主な発見

  • ヘブ型ネットワークは、CarRacing環境で全100回のロールアウトにおいて高いパフォーマンスを示し、堅牢性と一貫性を確認した。
  • 3次元四足歩行タスクでは、訓練中に遭遇しなかった形態的損傷に対しても、ヘブ型ネットワークは適応に成功したが、固定重みネットワークは失敗した。
  • 運用中、明示的な報酬や誤差信号なしに、100ステップ未満で適応が達成された。
  • 進化したヘブ型ルールにより、ネットワーク重みは重み空間において安定なアトラクタに収束し、迅速なパフォーマンス向上が実現された。
  • ヘブ型ネットワークは、重みの最大50%がランダムにゼロにされた後でも、機能し続け、適応可能であり、高い耐性を示した。
  • 特に動的で予期しない状況下において、静的重みネットワークに比べ、性能および適応性の両面で優れた性能を発揮した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。