[論文レビュー] Two Routes to Scalable Credit Assignment without Weight Symmetry
本稿では、重み対称性を必要としないスケーラブルな信用配分の生物学的に妥当な2つのルートを提案する:(1) 正則化に基づく重み整合性に由来するロバストな局所学習ルールで、調整なしにアーキテクチャを横断して適応可能であり、(2) バックプロパゲーションの性能に匹敵し、ノイズの多い更新に対しても非常に頑健な非局所的「重み推定」ルールである。主な貢献は、深層ネットワーク全体で高い性能を維持する、スケーラブルで神経的に妥当なバックプロパゲーションの代替手法を同定することにある。
The neural plausibility of backpropagation has long been disputed, primarily for its use of non-local weight transport $-$ the biologically dubious requirement that one neuron instantaneously measure the synaptic weights of another. Until recently, attempts to create local learning rules that avoid weight transport have typically failed in the large-scale learning scenarios where backpropagation shines, e.g. ImageNet categorization with deep convolutional networks. Here, we investigate a recently proposed local learning rule that yields competitive performance with backpropagation and find that it is highly sensitive to metaparameter choices, requiring laborious tuning that does not transfer across network architecture. Our analysis indicates the underlying mathematical reason for this instability, allowing us to identify a more robust local learning rule that better transfers without metaparameter tuning. Nonetheless, we find a performance and stability gap between this local rule and backpropagation that widens with increasing model depth. We then investigate several non-local learning rules that relax the need for instantaneous weight transport into a more biologically-plausible "weight estimation" process, showing that these rules match state-of-the-art performance on deep networks and operate effectively in the presence of noisy updates. Taken together, our results suggest two routes towards the discovery of neural implementations for credit assignment without weight symmetry: further improvement of local rules so that they perform consistently across architectures and the identification of biological implementations for non-local learning mechanisms.
研究の動機と目的
- ニューラルネットワークにおけるバックプロパゲーションの重み輸送要件の生物学的不実現性を解決すること。
- 深層ネットワークで性能を維持しながら、非局所的重み輸送を回避するスケーラブルで局所的な学習ルールを同定すること。
- 即時の重み輸送を必要としないように緩和する、非局所的学習メカニズムを探索すること。
- これらのルールがアーキテクチャ間でどれほど頑健で、およびノイズの多い更新下でどれほど転送可能であるかを評価すること。
- 機能的神経応答データが、学習済みネットワーク内の異なる信用配分メカニズムを区別できるかを評価すること。
提案手法
- 前向きおよび後向きの重みが動的に整合するように正則化することで、制約付き最適化問題として信用配分を定式化する。
- 幾何的プリミティブに分解可能な正則化項を用いた包括的フレームワークを導入し、学習ルールの系統的探索を可能にする。
- 結合されていない前向きおよび後向き重み間の正則化に基づく疑似勾配を用いる対称的整合性(SA)に基づく局所学習ルールを提案する。
- 正確な重み輸送を「重み推定」プロセスに置き換える非局所的学習ルールを設計し、フィードバック重みを用いて転置を近似する。
- ノイズの多い更新で性能をテストするため、同じノイズ条件でSAとバックプロパゲーションを比較してモデルを学習する。
- プライメート視覚皮質応答(V4、IT)に対する学習済み表現をPLS回帰を用いて評価し、生物学的妥当性を検証する。
実験結果
リサーチクエスチョン
- RQ1メタパrameterの調整なしに、多様な深層ネットワークアーキテクチャでバックプロパゲーションと競合する性能を示す局所学習ルールを設計できるか?
- RQ2既存の局所ルール(フィードバックアライメントやウェイトミラーなど)がなぜ深層ネットワークにスケーリングできないのか、その背後にある数学的性質は何か?
- RQ3正確な重み輸送ではなく、後向き重みを推定する非局所的学習ルールは、最先端の性能と頑健性を達成できるか?
- RQ4ノイズの多い勾配更新下での対称的整合性(SA)の頑健性は、バックプロパゲーションと比べてどの程度か?
- RQ5プライメート視覚皮質からの機能的神経応答データは、学習済みネットワーク内の異なる信用配分メカニズムを区別できるか?
主な発見
- 提案された対称的整合性(SA)ルールは、ResNet-18を用いたImageNetで競争力のある性能を達成し、メタパrameterの調整なしにさまざまなアーキテクチャに強く一般化する。
- SAはバックプロパゲーションよりも、勾配にガウスノイズが加わった場合でも顕著に頑健で、性能を維持する。
- 非局所的重み推定ルールは、深層ネットワークで最先端の性能に匹敵し、ノイズの多い更新下でも非常に安定しており、バックプロパゲーションの生物学的代替手段として有効であることが示唆される。
- フィードバックアライメントを除くすべての有効な学習ルールは、プライメートV4およびIT神経応答に対して類似した予測精度を達成しており、機能的データが、十分に学習されたネットワーク内の学習メカニズムを区別できない可能性を示している。
- モデルの深さが増すにつれて、SAとバックプロパゲーションの性能差が拡大するというギャップが同定され、局所学習ルールにおける未解決の課題が浮き彫りになった。
- 将来の生物学的に妥当な信用配分に関する研究を支援するため、任意のアーキテクチャと学習ルールを大規模に訓練可能なオープンソースのTensorFlowライブラリを公開した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。