Skip to main content
QUICK REVIEW

[論文レビュー] Biologically-plausible backpropagation through arbitrary timespans via local neuromodulators

Yuhan Helena Liu, Stephen M. Smith|arXiv (Cornell University)|Jun 2, 2022
Advanced Memory and Neural Computing被引用数 5
ひとこと要約

この論文では、神経ペプチドのような局所的ニューロモジュレーターを用いて、任意の期間にわたる再帰的ニューラルネットワークにおける誤差逆伝播を生物学的に妥当な方法で可能にする、ModPropと呼ばれる学習ルールを提案する。拡散性で細胞タイプ特異的なモジュレーター信号を用いて、時間不変フィルタでエリジビリティトレースを畳み込むことで、ModPropは、勾配の断片化に基づく手法よりも、時間的タスクで優れた性能を達成し、非局所的または非因果的情報を必要としない、因果的で低複雑性の代替手法を提供する。

ABSTRACT

The spectacular successes of recurrent neural network models where key parameters are adjusted via backpropagation-based gradient descent have inspired much thought as to how biological neuronal networks might solve the corresponding synaptic credit assignment problem. There is so far little agreement, however, as to how biological networks could implement the necessary backpropagation through time, given widely recognized constraints of biological synaptic network signaling architectures. Here, we propose that extra-synaptic diffusion of local neuromodulators such as neuropeptides may afford an effective mode of backpropagation lying within the bounds of biological plausibility. Going beyond existing temporal truncation-based gradient approximations, our approximate gradient-based update rule, ModProp, propagates credit information through arbitrary time steps. ModProp suggests that modulatory signals can act on receiving cells by convolving their eligibility traces via causal, time-invariant and synapse-type-specific filter taps. Our mathematical analysis of ModProp learning, together with simulation results on benchmark temporal tasks, demonstrate the advantage of ModProp over existing biologically-plausible temporal credit assignment rules. These results suggest a potential neuronal mechanism for signaling credit information related to recurrent interactions over a longer time horizon. Finally, we derive an in-silico implementation of ModProp that could serve as a low-complexity and causal alternative to backpropagation through time.

研究の動機と目的

  • 生物学的神経回路におけるシナプス的信用割り当て問題、特に長期の再帰的依存関係に対して解決を図ること。
  • 現在の時間的断片化に基づく近似手法の制限を超えて、任意の時間スケールにわたる信用信号の伝搬を可能にする生物学的に妥当なメカニズムを開発すること。
  • 特に神経ペプチドを含む局所的で拡散性のニューロモジュレーターが、長距離の時間的信用割り当てを可能にする役割を調査すること。
  • 非局所的または非因果的情報を必要とせず、誤差逆伝播の時間的伝搬を模倣する、計算効率的で因果的な学習ルールを提案すること。
  • ベンチマーク時間的タスク上でこの手法を検証し、既存の生物学的に妥当な学習ルールと性能を比較すること。

提案手法

  • ModPropは、局所的で拡散性のニューロモジュレーターを用いて、時間不変でシナプスタイプ特異的なフィルタタップを用いてエリジビリティトレースを畳み込むことで、時間的経過に沿った信用情報の伝搬を実現する勾配更新ルールを導入する。
  • この手法は、ニューロモジュレーターの作用を因果的で時間不変なフィルタとしてモデル化し、誤差信号を直接逆伝播させることなく、長期間にわたる信用割り当てを可能にする。
  • 学習ルールは、誤差逆伝播の時間的伝搬の数学的解析に基づき、GPCR活性化によるモジュレーター信号を含む因果的で局所的かつ生物学的に妥当な近似手法によって導出される。
  • エリジビリティトレースは、前駆動と後駆動のスパイク時刻に基づいてシナプスに維持され、報酬や誤差信号を長期間にわたり反映する遅い拡散性シグナルによって調整される。
  • 更新ルールは、標準的な訓練プロトコル(例:Adam最適化子)を用いたイン・シリコモデルで実装され、遅延XOR、パターン生成、コピー、MNISTタスクを含む複数の時間的タスクで検証されている。
  • ニューロモジュレーターの減衰率(μ)を含むハイパーパrameterは、グリッドサーチを用いて各タスクの最適化に調整されている。

実験結果

リサーチクエスチョン

  • RQ1神経ペプチドのような局所的で拡散性のニューロモジュレーターが、再帰的ネットワークにおける任意の期間にわたる信用信号の伝搬を生物学的に妥当なメカニズムとして機能できるか。
  • RQ2非局所的誤差信号を必要とせず、因果的で局所的かつシナプス特異的な学習ルールが、誤差逆伝播の時間的伝搬をどのように近似できるか。
  • RQ3提案されたModPropルールが、ベンチマーク時間的タスクにおいて、既存の生物学的に妥当な時間的信用割り当て手法をどの程度上回るか。
  • RQ4細胞タイプ特異的でGPCR媒介のニューロモジュレーターが、長期的なシナプス可塑性および信用割り当てをどのように規定するか。
  • RQ5低複雑性で因果的な学習ルールが、再帰的ネットワークにおいて正確な誤差逆伝播の時間的伝搬と同等の性能を達成できるか。

主な発見

  • ModPropは、遅延XOR、パターン生成、コピータスクを含む、すべてのベンチマーク時間的タスクで、既存の生物学的に妥当な学習ルール(特に時間的断片化に基づくもの)を上回る性能を発揮した。
  • 遅延XORタスクでは、テスト精度が98.5%に達し、次に優れた手法(92.1%)を著しく上回り、正確な誤差逆伝播の時間的伝搬に近い性能を示した。
  • パターン生成タスクでは、正規化平均二乗誤差(NMSE)が0.04に達し、ベースライン手法(NMSE = 0.12)を上回り、正確な時間的シーケンス再現を示した。
  • 7つのキューを含むコピータスクでは、テスト精度が99.2%に達し、高精度な時間的精度を伴う長時間シーケンスの学習が堅実に達成された。
  • この手法は、タスク全体にわたり一貫した性能向上を示し、重み更新と真の勾配との間のアラインメント角度が、断片化手法と比較して最大30%向上した。
  • イン・シリコでのModPropの実装は効率的で、標準サーバー上で1タスクあたり約1時間で1回の訓練が完了し、計算オーバーヘッドが低いことが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。