Skip to main content
QUICK REVIEW

[論文レビュー] ReZero is All You Need: Fast Convergence at Large Depth

Thomas Bachlechner, Bodhisattwa Prasad Majumder|arXiv (Cornell University)|Mar 10, 2020
Domain Adaptation and Few-Shot Learning参考文献 39被引用数 150
ひとこと要約

この論文は ReZero を提案します。ゼロ初期化された残差ゲートは初期のダイナミカル等方性を可能にし、極めて深いネットワークの訓練を可能にするとともに、FC ネット、ResNet、Transformer にわたって学習の収束を速くします。

ABSTRACT

Deep networks often suffer from vanishing or exploding gradients due to inefficient signal propagation, leading to long training times or convergence difficulties. Various architecture designs, sophisticated residual-style networks, and initialization schemes have been shown to improve deep signal propagation. Recently, Pennington et al. used free probability theory to show that dynamical isometry plays an integral role in efficient deep learning. We show that the simplest architecture change of gating each residual connection using a single zero-initialized parameter satisfies initial dynamical isometry and outperforms more complex approaches. Although much simpler than its predecessors, this gate enables training thousands of fully connected layers with fast convergence and better test performance for ResNets trained on CIFAR-10. We apply this technique to language modeling and find that we can easily train 120-layer Transformers. When applied to 12 layer Transformers, it converges 56% faster on enwiki8.

研究の動機と目的

  • 勾配の消失・爆発により、非常に深いネットワークの訓練が難しいことを動機づける。
  • 初期のダイナミカル等方性を強制する、簡潔でアーキテクチャに依存しない修正を提案する。
  • 複数のアーキテクチャ(FCN、CNN/ResNet、Transformers)において、大規模深さの訓練能力と収束速度の改善を示す。
  • CIFAR-10 および enwiki8 のような言語モデリングベンチマークで経験的な向上を示す。

提案手法

  • 各層に残差ゲート alpha を追加し、alpha をゼロに初期化する: x_{i+1}=x_i+alpha_i F(x_i).
  • この初期化により、初期はネットワークが恒等写像のように振る舞い、ダイナミカル等方性を達成することを示す。
  • ReZero を全結合ネットワーク、畳み込み ResNet、および Transformer アーキテクチャに適用する。
  • 標準的な残差や正規化ベースのアプローチと比較して、収束速度と最終性能を比較する。
  • 訓練中の信号伝搬が維持されることを示すためにヤコビ行列スペクトルを分析する。

実験結果

リサーチクエスチョン

  • RQ1最小限のゼロ初期化残差ゲートは、正規化なしで極めて深いネットワークの安定した訓練を可能にするか。
  • RQ2ReZero は FCN、CNN/ResNet、および Transformer における収束速度とテスト性能にどのような影響を与えるか。
  • RQ3alpha をゼロに初期化することは、ゼロ以外(1 など)に初期化する場合と比べて訓練ダイナミクスにどの程度影響を与えるか。
  • RQ4現代のアーキテクチャに ReZero を適用した場合の深さと深さに関連する性能向上の実用的な限界は何か。
  • RQ5ReZero は深層モデルにおけるウォームアップや重い正規化の必要性を減らすか、あるいは排除するか。

主な発見

  • ReZero は数千層のネットワークの訓練を可能にする(例: 10,000-layer FC networks)。
  • 100 層を超える Transformer は ReZero の下で LayerNorm やウォームアップなしで訓練できる。
  • enwiki8 の場合、ReZero を用いた 12 層 Transformer は、通常の Transformer より 56%速く 1.2 BPB へ収束する。
  • CIFAR-10 では、ReZero を用いた ResNet の variants は収束が速く、テスト精度も向上する(例: ReZero を用いた ResNet-110 は指標が改善)。
  • ReZero は CIFAR-10 の訓練を、複数の ResNet 深さにおいて、目標精度に到達するまでのイテレーション数を最大約32%程度加速する。
  • より深い Transformer(64、128 層)では、ReZero は Post-Norm/GPT2-Norm 配置よりもダイナミカル等方性を保ち、通常の Transformer が発散するところを訓練可能にする。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。