Skip to main content
QUICK REVIEW

[論文レビュー] LipsFormer: Introducing Lipschitz Continuity to Vision Transformers

Xianbiao Qi, Jianan Wang|arXiv (Cornell University)|Apr 19, 2023
Neural Networks and Reservoir Computing被引用数 4
ひとこと要約

LipsFormerは、LayerNormをCenterNormに置き換え、ドット積注意機構をスケーリングされたコサイン類似度注意機構に置き換え、残差接続を重み付きバージョンに置き換え、Xavier初期化をスペクトル初期化に置き換えることで、不安定なコンponentsを理論的根拠に基づいて置き換える、リプシッツ連続なビジョントランスフォーマー・アーキテクチャを提案する。この設計により、学習率のウォームアップを必要とせず安定した学習が可能となり、Swin-Tinyを用いて300エポックでImageNet-1Kで82.7%のトップ1精度を達成し、CSwin-Tinyを用いて83.5%を達成する。

ABSTRACT

We present a Lipschitz continuous Transformer, called LipsFormer, to pursue training stability both theoretically and empirically for Transformer-based models. In contrast to previous practical tricks that address training instability by learning rate warmup, layer normalization, attention formulation, and weight initialization, we show that Lipschitz continuity is a more essential property to ensure training stability. In LipsFormer, we replace unstable Transformer component modules with Lipschitz continuous counterparts: CenterNorm instead of LayerNorm, spectral initialization instead of Xavier initialization, scaled cosine similarity attention instead of dot-product attention, and weighted residual shortcut. We prove that these introduced modules are Lipschitz continuous and derive an upper bound on the Lipschitz constant of LipsFormer. Our experiments show that LipsFormer allows stable training of deep Transformer architectures without the need of careful learning rate tuning such as warmup, yielding a faster convergence and better generalization. As a result, on the ImageNet 1K dataset, LipsFormer-Swin-Tiny based on Swin Transformer training for 300 epochs can obtain 82.7\% without any learning rate warmup. Moreover, LipsFormer-CSwin-Tiny, based on CSwin, training for 300 epochs achieves a top-1 accuracy of 83.5\% with 4.7G FLOPs and 24M parameters. The code will be released at \url{https://github.com/IDEA-Research/LipsFormer}.

研究の動機と目的

  • ビジョントランスフォーマーにおける初期化時における学習不安定性という、長年の課題に取り組む。
  • 学習率のウォームアップや正規化といった一般的なトレーニングテクニックよりも、リプシッツ連続性がより根本的な性質であることを特定する。
  • 正規化、注意機構、残差接続、重み初期化の主要コンポONENTにわたるリプシッツ連続性を強制する包括的なフレームワークを開発する。
  • リプシッツ定数の理論的上限を導出し、安定なネットワーク設計を支援する。
  • LipsFormerがハイパーパramータチューニングを伴わず、学習率のウォームアップなしに安定したエンドツーエンド学習を可能にすることを示す。

提案手法

  • LayerNormを、スケーリングを行わず特徴を中央化するリプシッツ連続な正規化層であるCenterNormに置き換える。
  • ドット積自己注意機構を、適切なスケーリングのもとでリプシッツ連続であることが証明されたスケーリングされたコサイン類似度注意機構に置き換える。
  • 学習可能な、ゼロ初期化されたゲートを備えた重み付き残差ショートカットを導入し、残差更新の安定化を図る。
  • Xavier初期化の代わりにスペクトルに基づく重み初期化を適用し、初期化段階での有界なスペクトルノルムを保証する。
  • リプシッツ関数の合成則を用いて、LipsFormerアーキテクチャ全体のリプシッツ定数の理論的上限を導出する。
  • SwinおよびCSwinトランスフォーマーの標準的なコンポONENTを、それらのリプシッツ連続性を備えた同等物に置き換えることで、LipsFormer-SwinおよびLipsFormer-CSwinを構築する。
Figure 1: Comparison of a LipsFormer block with ConvNeXt, Transformer and Swin-Transformer Blocks. We use different colors to mark our Lipschitz improvements.
Figure 1: Comparison of a LipsFormer block with ConvNeXt, Transformer and Swin-Transformer Blocks. We use different colors to mark our Lipschitz improvements.

実験結果

リサーチクエスチョン

  • RQ1主要なトランスフォーマー部品にリプシッツ連続性を強制することで、学習率のウォームアップなしに安定した学習が可能になるか?
  • RQ2トランスフォーマー・ネットワークの理論的リプシッツ定数は、その実用的学習可能性および一般化性能とどのように関係するか?
  • RQ3標準的なトランスフォーマーにおける、リプシッツ連続性を破る具体的なアーキテクチャ的コンポONENTは何か?また、それらが学習不安定性に寄与しているか?
  • RQ4段階的な改善(例:DeepNorm や ReZero)に比べ、包括的なリプシッツ設計が学習安定性および収束性において優れているか?
  • RQ5リプシッツ連続なトランスフォーマーは、ハイパーパramータチューニングなしに、ImageNet-1Kなどの標準ベンチマークで性能を維持または向上させられるか?

主な発見

  • LipsFormerは、学習率のウォームアップなしに、Swin-Tinyを用いて300エポックでImageNet-1Kで82.7%のトップ1精度を達成する。
  • LipsFormer-CSwin-Tinyは、4.7G FLOPsおよび24Mパラメータで、学習率のウォームアップなしに83.5%のトップ1精度を達成する。
  • LipsFormerのリプシッツ定数の理論的上限が導出され、初期化段階で有限であることが示され、原理的安定性保証が得られた。
  • 実験により、ウォームアップなしにネットワークが安定し、かつより速く収束することが確認され、リプシッツ連続性の仮定が妥当であることが裏付けられた。
  • 提案されたコンポONENT(CenterNorm、スケーリングされたコサイン注意機構、重み付き残差ショートカット、スペクトル初期化)は、既存のビジョントランスフォーマーアーキテクチャにそのまま差し替え可能な代替コンポONENTとして利用可能である。
  • LipsFormerは、ハイパーパramータチューニングを慎重に行わなくても、標準的なSwinおよびCSwinベースラインを上回る学習安定性および一般化性能を示し、特に深層アーキテクチャにおいて顕著である。
Figure 2: Sigmoid, Tanh, ReLU and GELU activation function.
Figure 2: Sigmoid, Tanh, ReLU and GELU activation function.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。