Skip to main content
QUICK REVIEW

[論文レビュー] Re-purposing Compact Neuronal Circuit Policies to Govern Reinforcement Learning Tasks.

Ramin Hasani, Mathias Lechner|arXiv (Cornell University)|Sep 11, 2018
Neural dynamics and brain function参考文献 30被引用数 5
ひとこと要約

この論文は、*C. elegans* にインspiredされた、液体時定数と解釈可能なダイナミクスを用いて強化学習タスクを制御する、新しい再帰的ニューラルネットワークであるNeuronal Circuit Policies (NCPs) を導入する。NCPsが有限時間ダイナミクス系を任意に近似できることを示し、シミュレートされたタスクおよび実世界のタスク(自律ローバーの駐車を含む)において深層強化学習(DRL)と同等の性能を達成するとともに、探索ベースの強化学習を用いて再利用可能な生物学的回路モデルを介して細胞レベルでの解釈可能性を実現している。

ABSTRACT

We propose an effective method for creating interpretable control agents, by extit{re-purposing} the function of a biological neural circuit model, to govern simulated and real world reinforcement learning (RL) test-beds. Inspired by the structure of the nervous system of the soil-worm, \emph{C. elegans}, we introduce \emph{Neuronal Circuit Policies} (NCPs) as a novel recurrent neural network instance with liquid time-constants, universal approximation capabilities and interpretable dynamics. We theoretically show that they can approximate any finite simulation time of a given continuous n-dimensional dynamical system, with $n$ output units and some hidden units. We model instances of the policies and learn their synaptic and neuronal parameters to control standard RL tasks and demonstrate its application for autonomous parking of a real rover robot on a pre-defined trajectory. For reconfiguration of the \emph{purpose} of the neural circuit, we adopt a search-based RL algorithm. We show that our neuronal circuit policies perform as good as deep neural network policies with the advantage of realizing interpretable dynamics at the cell-level. We theoretically find bounds for the time-varying dynamics of the circuits, and introduce a novel way to reason about networks' dynamics.

研究の動機と目的

  • 生物学的ニューラル回路モデルを再利用することで、強化学習のための解釈可能な制御エージェントを開発すること。
  • 深層ニューラルネットワーク方策における解釈可能性の欠如を是正しつつ、RLタスクにおける競争力ある性能を維持すること。
  • 解釈可能な方策の実世界への展開を可能とすることを、物理的ローバー・ロボットを用いて実証すること。
  • 液体時定数を有する再帰的ニューラルネットワークにおける時変ダイナミクスの理論的境界を確立すること。
  • 生物学的に妥当な回路構造を根拠とした、ネットワークダイナミクスに関する新たなフレームワークを提供すること。

提案手法

  • 液体時定数を備えた再帰的ニューラルネットワークの変種としてNeuronal Circuit Policies (NCPs) を設計し、動的で時間に依存する応答を可能とする。
  • *C. elegans* の神経系の構造的・機能的組織を、NCPアーキテクチャの青写真として活用する。
  • 理論的に、NCPsがn出力ユニットを備えた連続n次元ダイナミクス系の有限時間シミュレーションを、n個の出力ユニットと若干の隠れユニットを用いて普遍的に近似可能であることを証明する。
  • シナプスおよびニューロンパラメータのチューニングにより、神経回路の目的を再構成するための探索ベースの強化学習アルゴリズムを用いる。
  • 回路レベルの解釈可能性に裏付けられた、時間変動する状態遷移を用いたネットワークダイナミクスに関する新たな推論手法を導入する。
  • 標準的なRLベンチマークでNCPsを訓練し、定められた軌道に沿った自律駐車を実現する物理的ローバーに展開する。

実験結果

リサーチクエスチョン

  • RQ1解釈可能なダイナミクスを有する生物学的インスパイア型再帰的ネットワークが、普遍近似特性を備えて任意の有限時間ダイナミクス系を近似できるか。
  • RQ2Neuronal Circuit Policies (NCPs) が、標準的な強化学習ベンチマークにおいて深層ニューラルネットワーク方策と比べてどの程度の性能を示すか。
  • RQ3同じ神経回路モデルが、RLを用いたパラメータ再構成によって、複数の異なる制御タスクに再利用可能か。
  • RQ4液体時定数を有するこのようなネットワークにおける時変ダイナミクスに、どのような理論的境界を導出できるか。
  • RQ5実世界のロボット制御において性能を損なわずに、細胞レベルでの解釈可能なダイナミクスを達成できるか。

主な発見

  • Neuronal Circuit Policies (NCPs) は、n出力ユニットと若干の隠れユニットを備えた、連続n次元ダイナミクス系の有限時間シミュレーションを、普遍的に近似可能である。
  • NCPs は、連続制御ベンチマークを含む、標準的な強化学習タスクにおいて、深層ニューラルネットワーク方策と同等の性能を達成する。
  • NCPフレームワークは、定められた軌道に沿った物理的ローバーの自律駐車に成功することで、実世界への展開が可能であることを実証している。
  • 理論的分析により、回路の時変ダイナミクスの境界が確立され、その行動を推論する基盤が提供されている。
  • シナプスおよびニューロンパラメータのチューニングにより、探索ベースのRLアルゴリズムを用いて回路の目的の再構成が効果的に達成されている。
  • NCPs は細胞レベルでの解釈可能なダイナミクスを提供し、個々のニューロンの寄与度についての洞察を可能としている(標準的な深層RL方策とは対照的)。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。