Skip to main content
QUICK REVIEW

[論文レビュー] Scaling Forward Gradient With Local Losses

Mengye Ren, Simon Kornblith|arXiv (Cornell University)|Oct 7, 2022
Domain Adaptation and Few-Shot Learning被引用数 12
ひとこと要約

この論文は、活性化の摂動と局所的なグリーディ損失を用いた前向き勾配学習により、勾配の分散を低減しスケーラビリティを向上させる、生物学的に妥当な深層学習手法を提案する。重みではなく活性化に摂動を適用し、グループ化され局所的な損失を持つ新しいLocalMixerアーキテクチャを採用することで、MNISTおよびCIFAR-10では誤反転誤差と同等の性能を達成し、ImageNetでは従来の誤反転なし手法を著しく上回る。

ABSTRACT

Forward gradient learning computes a noisy directional gradient and is a biologically plausible alternative to backprop for learning deep neural networks. However, the standard forward gradient algorithm, when applied naively, suffers from high variance when the number of parameters to be learned is large. In this paper, we propose a series of architectural and algorithmic modifications that together make forward gradient learning practical for standard deep learning benchmark tasks. We show that it is possible to substantially reduce the variance of the forward gradient estimator by applying perturbations to activations rather than weights. We further improve the scalability of forward gradient by introducing a large number of local greedy loss functions, each of which involves only a small number of learnable parameters, and a new MLPMixer-inspired architecture, LocalMixer, that is more suitable for local learning. Our approach matches backprop on MNIST and CIFAR-10 and significantly outperforms previously proposed backprop-free algorithms on ImageNet.

研究の動機と目的

  • 大規模な深層ネットワークにおける標準的な前向き勾配学習の高い分散と低いスケーラビリティを解消する。
  • 対称的な後向き重み伝搬とグローバル同期を回避する、誤反転の生物学的に妥当な代替手法を開発する。
  • 活性化の摂動と局所的損失関数による勾配分散の低減を通じて、訓練の安定性と性能を向上させる。
  • 局所学習とモデル並列計算に最適化された、新しいアーキテクチャ、LocalMixerを設計する。
  • 誤反転に依存せずに、標準的なビジョンベンチマーク(MNIST、CIFAR-10、ImageNet)で実用的な性能を示す。

提案手法

  • 重みではなく活性化に摂動を適用し、前向きモードの自動微分を用いて方向勾配を計算することで、勾配分散を低減する。
  • 多数の局所的グリーディ損失関数を導入し、それぞれが小さなパラメータサブセットのみに依存するようにすることで、学習の分離と分散の低減を実現する。
  • MLPMixerをインspiredしたLocalMixerアーキテクチャを設計し、線形トークン混合とグループ化されたチャネル操作を特徴とすることで、局所学習との相性を高める。
  • ストップ勾配操作を用いて、局所予測をメインネットワークから分離し、独立した局所最適化を可能にする。
  • 訓練の安定化と一般化性能の向上のため、戦略的配置の正規化層(BatchNorm、LayerNorm、LocalNorm)を適用する。
  • 局所およびグローバルな予測ヘッドを備えたマルチステージ訓練パイプラインを実装し、局所的およびグローバルな信号伝搬を可能にする。

実験結果

リサーチクエスチョン

  • RQ1大規模な深層ネットワークにおいて、活性化の摂動を用いた前向き勾配学習は、重みの摂動よりも低い分散を達成できるか?
  • RQ2グループ化されパッチ単位の構造を持つ局所的グリーディ損失関数は、誤反転なし学習における訓練の安定性と性能にどのように影響するか?
  • RQ3MLPMixerを模したような新しいアーキテクチャ、LocalMixerは、誤反転なしでImageNetレベルのベンチマークに有効な局所学習を可能にできるか?
  • RQ4正規化手法(BN、LN、LocalNorm)は、局所的前向き勾配訓練の性能にどのような影響を及えるか?
  • RQ5活性化の摂動、局所的損失、および特化したアーキテクチャの組み合わせは、既存の誤反転なし手法を、標準的なビジョンベンチマークで上回ることができるか?

主な発見

  • 活性化の摂動は、重みの摂動よりも顕著に低い分散の勾配推定をもたらし、高次元設定でもより安定した訓練を可能にする。
  • MNISTおよびCIFAR-10では、提案されたLocal Forward Gradient (LG-FG-A) 法が誤反転と同等のテスト精度を達成する(例:LayerNormを用いたCIFAR-10では33.48%のテスト誤差、誤反転では30.55%)。
  • ImageNetでは、すべての従来の誤反転なしアルゴリズムを上回り、LayerNormを用いた場合37.41%のトップ1精度、LocalNormを用いた場合36.24%を達成し、既存の代替手法と顕著に優れている。
  • 局所損失関数におけるグループ数の増加により、前向き勾配学習で訓練誤差が最大10%まで低下し、勾配分散の低減と最適化の改善が示された。
  • グループ化され局所的な学習コンponentsを備えたLocalMixerアーキテクチャは、効果的なモデル並列訓練を可能にし、グローバル信号が限られている状況でも強力な性能を発揮する。
  • LocalNormのような正規化手法は一般化性能を顕著に向上させ、前向き勾配学習において、正規化なしと比較してテスト誤差を最大5%まで低減する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。