Skip to main content
QUICK REVIEW

[論文レビュー] Meta-Reinforcement Learning with Self-Modifying Networks

Mathieu Chalvidal, T. Serre|arXiv (Cornell University)|Feb 4, 2022
Data Stream Mining Techniques被引用数 5
ひとこと要約

本論文は、内部のシナプス状態と外部の報酬信号に条件付けられた自己参照的更新ルールを用いて、ニューラルネットワークがリアルタイムでシナプス結合重みを自己修正できるメタ強化学習フレームワーク、MetODSを提案する。このモデルは、1層の軽量な層を用いて1回の試行学習、未観測環境への一般化、連続的モータ制御の強靭性を達成し、勾配ベースの重み更新なしに高速で動的可塑性が強力で適応的な強化学習を支える可能性を示している。

ABSTRACT

Deep Reinforcement Learning has demonstrated the potential of neural networks tuned with gradient descent for solving complex tasks in well-delimited environments. However, these neural systems are slow learners producing specialized agents with no mechanism to continue learning beyond their training curriculum. On the contrary, biological synaptic plasticity is persistent and manifold, and has been hypothesized to play a key role in executive functions such as working memory and cognitive flexibility, potentially supporting more efficient and generic learning abilities. Inspired by this, we propose to build networks with dynamic weights, able to continually perform self-reflexive modification as a function of their current synaptic state and action-reward feedback, rather than a fixed network configuration. The resulting model, MetODS (for Meta-Optimized Dynamical Synapses) is a broadly applicable meta-reinforcement learning system able to learn efficient and powerful control rules in the agent policy space. A single layer with dynamic synapses can perform one-shot learning, generalizes navigation principles to unseen environments and manifests a strong ability to learn adaptive motor policies.

研究の動機と目的

  • 固定されたトレーニングカリキュラムを超えて継続的かつ適応的学習を可能にするメタ強化学習システムの開発。
  • 自己参照的シナプス結合重みの更新が、迅速なタスク特化と認知的柔軟性を支えるかどうかの調査。
  • 迅速なシナプス可塑性が、人工エージェントにおける効率的で汎用的な強化学習を可能にする役割を解明すること。
  • 未確認の環境やモータ障害下におけるモデルの強靭性と一般化能力の評価。

提案手法

  • シナプス結合重みの変更が現在のシナプス状態とアクション-報酬フィードバックに依存する自己参照的重み更新ルールを採用。
  • 動的シナプスは、内部状態と報酬履歴に基づいてポリシーを調整するフィードバック制御機構を用いてリアルタイムで更新。
  • バックプロパゲーションを時間的に通るのを避けるために、ポリシー空間におけるモデルフリーな確率的フィードバック制御として定式化。
  • 1層のネットワークで、1回の試行学習や連続的モータ制御を含む多様な認知的機能を実装するための軽量なパrametrizationを採用。
  • エピソード全体を通じてメタ報酬を最適化するようにエンドツーエンドで訓練され、新しいタスクへの迅速な適応が可能。
  • シナプスダイナミクスは生物学的高速可塑性にインspiredされ、再トレーニングなしにネットワーク機能の迅速な再構成を可能にする。

実験結果

リサーチクエスチョン

  • RQ1自己参照的シナプス更新を有するニューラルネットワークは、1回の試行学習と未観測環境への一般化を達成できるか?
  • RQ2適応性とサンプル効率の観点から、動的シナプス可塑性は標準的な勾配ベースの学習と比べてどのように異なるか?
  • RQ3自己修正型ネットワークはモータ障害下でも性能を維持できるか。これは強靭性を示唆するか?
  • RQ4動的重みを有する1層ネットワークが、どのように複雑な制御ポリシーを実装できるか。
  • RQ5迅速なシナプス可塑性は、適応的強化学習エージェントの学習に勾配降下の代替手段として実用的であると見なせるか?

主な発見

  • MetODSは、MetaWorldベンチマークにおいて、1000万ステップのトレーニングしか行わなくても、ベースライン手法と比較して優れたメタテスト成功確率を達成した。
  • モデルは1回の試行学習の能力を示し、未確認の環境へもナビゲーション原理を一般化した。
  • 連続的歩行タスクでは、モータ能力に障害が生じた場合でも、元の性能の高い割合を維持しており、強靭性を示した。
  • トレーニング初期段階でベースライン手法を上回ったため、収束が早く、サンプル効率に優れていることが示唆された。
  • プッシュ、レッチ、ML-10環境を含む多様なタスクにおいて、強い一般化性能を示したが、一部のケースではML-10でやや低いパフォーマンスを示した。
  • 結果は、自己参照的シナプス可塑性が、自律的かつ適応的強化学習プログラムの基盤として機能しうることを支持する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。