Skip to main content
QUICK REVIEW

[論文レビュー] Large-Scale Gradient-Free Deep Learning with Recursive Local Representation Alignment

Alexander G. Ororbia, Ankur Mali|arXiv (Cornell University)|Feb 10, 2020
Domain Adaptation and Few-Shot Learning参考文献 59被引用数 5
ひとこと要約

本稿では、再帰的局所表現アライメント(rec-LRA)を提案する。これは勾配フリーの深層学習アルゴリズムであり、隣接層間の局所表現を再帰的フィードバックによってアライメントすることで、バックプロパゲーションを用いずに並列的かつ生物学的に妥当な重み更新を可能にする。実験の結果、CIFAR-10およびImageNetにおいてバックプロパゲーションと同等の性能を達成し、並列性のおかげで収束が速く、トレーニングが著しく高速化された。バックプロパゲーションを必要とせず大規模データセットへのスケーラビリティを示した。

ABSTRACT

Training deep neural networks on large-scale datasets requires significant hardware resources whose costs (even on cloud platforms) put them out of reach of smaller organizations, groups, and individuals. Backpropagation, the workhorse for training these networks, is an inherently sequential process that is difficult to parallelize. Furthermore, it requires researchers to continually develop various tricks, such as specialized weight initializations and activation functions, in order to ensure a stable parameter optimization. Our goal is to seek an effective, neuro-biologically-plausible alternative to backprop that can be used to train deep networks. In this paper, we propose a gradient-free learning procedure, recursive local representation alignment, for training large-scale neural architectures. Experiments with residual networks on CIFAR-10 and the large benchmark, ImageNet, show that our algorithm generalizes as well as backprop while converging sooner due to weight updates that are parallelizable and computationally less demanding. This is empirical evidence that a backprop-free algorithm can scale up to larger datasets.

研究の動機と目的

  • 対称的な後向きパスを必要としない生物学的に妥当な勾配フリーのバックプロパゲーション代替手法の開発。
  • 層間の局所表現アライメントを活用することで、深層ネットワークにおける効率的で並列化可能な重み更新の実現。
  • バックプロパゲーションフリーのアルゴリズムが、ImageNetのような大規模ベンチマークに競争力のある一般化性能でスケーラブルに拡張可能であることを示すこと。
  • 特殊な重み初期化や非線形活性化関数のチューニングといったヒューリスティック手法への依存を減らすために、より安定した局所学習ルールを用いること。
  • さらにトレーニングを高速化するために、畳み込み演算を学習可能なフィルタではなく固定ノイズマップ(pconv)に置き換える可能性の検討。

提案手法

  • アルゴリズムは再帰的フィードバックを用いて隣接層間の局所表現をアライメントし、バックプロパゲーションを用いずに責任割り当てを可能にする。
  • 誤差信号を局所アライメントステップの連鎖を通じて伝搬する再帰的フィードバック機構を採用し、表現類似度に基づいて重みを更新する。
  • 重み更新は、出力層から導出されたターゲット表現と隠れ層表現をアライメントする局所的でヘブニアンに類似したルールで計算される。
  • 標準的なバックプロパゲーションに代えて、勾配を近似する固定ランダム行列を用いたフィードバックループを導入することで、計算およびメモリのオーバーヘッドを低減する。
  • 学習可能なフィルタの代わりに固定ノイズマップを用いる疑似畳み込み(pconv)を導入し、性能を維持したままトレーニングを加速する。
  • 非微分可能活性化関数をサポートし、局所的かつ非逐次的な更新メカニズムのおかげで消失/爆発勾配問題に対しても頑健である。

実験結果

リサーチクエスチョン

  • RQ1勾配フリーの学習アルゴリズムは、ImageNetのような大規模データセットにおいてバックプロパゲーションと同等の一般化性能を達成できるか?
  • RQ2再帰的かつ局所的表現アライメント機構により、バックプロパゲーションと比較して収束が速く、トレーニング時間が短縮されるか?
  • RQ3バックプロパゲーションや複雑なハイパーパramータチューニングを必要とせず、深層アーキテクチャに効果的にスケーリング可能か?
  • RQ4学習可能な畳み込みではなく固定ノイズマップ(pconv)を用いることで、モデル性能とトレーニング速度にどのような影響を与えるか?
  • RQ5非微分可能活性化関数を用いた場合、アルゴリズムはどの程度安定的かつ有効に保たれるか?

主な発見

  • ImageNetでは、rec-LRAはトップ-1誤差30.48%、トップ-5誤差11.97%を達成し、バックプロパゲーションベースラインの28.15%および9.81%に非常に近い性能を示した。
  • 8枚のV100 GPUを用いたトレーニングでは、rec-LRAは3時間12分で完了したのに対し、バックプロパゲーションは3時間45分かかった。これにより、1エポックあたり2.127分の高速化が達成された。
  • CIFAR-10では、フィードフォワードアライメントやターゲットプロパゲーションといった他の勾配フリー手法を上回り、バックプロパゲーションに近い性能を達成した。
  • ResNetをバックプロパゲーションでトレーニングした場合と比較して、rec-LRAはより滑らかに収束し、MNISTおよびFMNISTでも収束が速かった。
  • 64個の固定ノイズマスクを用いたpconvを標準畳み込みの代わりに使用した場合、性能の低下はほとんどなく、ミニバッチあたり0.73秒の高速化が得られた。
  • rec-LRAは非微分可能活性化関数に対しても頑健であり、特殊な重み初期化や活性化関数のエンジニアリングの必要性を排除した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。