Skip to main content
QUICK REVIEW

[論文レビュー] Improve Vision Transformers Training by Suppressing Over-smoothing

Chengyue Gong, Dilin Wang|arXiv (Cornell University)|Apr 26, 2021
Advanced Neural Network Applications参考文献 4被引用数 22
ひとこと要約

この論文では、アーキテクチャの変更なしに、自己注意層における過剰なスムージングが特徴の崩壊や性能劣化を引き起こすのを防ぐための訓練安定化技術を提案する。Cutmixに合わせた特徴多様性を促進する損失関数とピクセル分類ヘッドを導入することで、追加パラメータや教師モデルを用いずに、より深く広いビジョントランスフォーマーがImageNetで85.0%のトップ1精度を達成可能となる。

ABSTRACT

Introducing the transformer structure into computer vision tasks holds the promise of yielding a better speed-accuracy trade-off than traditional convolution networks. However, directly training vanilla transformers on vision tasks has been shown to yield unstable and sub-optimal results. As a result, recent works propose to modify transformer structures by incorporating convolutional layers to improve the performance on vision tasks. This work investigates how to stabilize the training of vision transformers \emph{without} special structure modification. We observe that the instability of transformer training on vision tasks can be attributed to the over-smoothing problem, that the self-attention layers tend to map the different patches from the input image into a similar latent representation, hence yielding the loss of information and degeneration of performance, especially when the number of layers is large. We then propose a number of techniques to alleviate this problem, including introducing additional loss functions to encourage diversity, prevent loss of information, and discriminate different patches by additional patch classification loss for Cutmix. We show that our proposed techniques stabilize the training and allow us to train wider and deeper vision transformers, achieving 85.0\% top-1 accuracy on ImageNet validation set without introducing extra teachers or additional convolution layers. Our code will be made publicly available at this https URL .

研究の動機と目的

  • 訓練中に不安定さや最適でない性能を示すヴァニラビジョントランスフォーマーの問題を解消すること。
  • 深層トランスフォーマーにおける特徴の崩壊と性能劣化の根本的原因として、自己注意層における過剰スムージングを同定すること。
  • トランスフォーマーのアーキテクチャを変更せず、畳み込み層を追加しないまま訓練の安定性とモデル容量を向上させること。
  • 特徴の多様性と情報の保持を通じて、より深く広いビジョントランスフォーマーの訓練を可能にすること。
  • アーキテクチャの変更なしに、損失関数に基づく正則化技術のみを用いてImageNetで最先端の精度を達成すること。

提案手法

  • Cutmix増強中における特徴の識別能を向上させるために、補助的なピクセル分類ヘッドを導入する。
  • 画像ピクセル間の異なる表現を促進するために、多様性を促進する損失関数を適用する。
  • 対照的な損失を用いて、ピクセル間の差を保持することで特徴の崩壊を防ぐ。
  • Cutmixデータ増強とピクセル分類損失を統合することで一般化性能を向上させる。
  • これらの損失成分を用いて、標準的な自己注意メカニズムを用いたビジョントランスフォーマーを訓練するが、訓練を安定化させる。
  • 残差接続や畳み込み的インダクティブバイアスなどのアーキテクチャ的変更を避ける。

実験結果

リサーチクエスチョン

  • RQ1自己注意メカニズムのみを用いた場合、ビジョントランスフォーマーの訓練にどのような不安定要因があるか?
  • RQ2自己注意層における過剰スムージングが特徴表現とモデル精度にどのように影響するか?
  • RQ3ビジョントランスフォーマーのアーキテクチャを変更せずに、訓練の安定性を向上させることは可能か?
  • RQ4損失に基づく正則化技術のみを用いて、どれほど深く広いビジョントランスフォーマーを訓練できるか?
  • RQ5追加パラメータや知識蒸留なしに、ImageNetで高い精度を達成することは可能か?

主な発見

  • 提案手法はアーキテクチャの変更なしにビジョントランスフォーマーの訓練を安定化させ、より深く広いモデルの信頼性ある訓練を可能にする。
  • モデルはImageNet検証セットで85.0%のトップ1精度を達成し、知識蒸留や追加パラメータを一切使用しない最先端の結果と同等の性能を示す。
  • ピクセル分類ヘッドと多様性損失の追加により、過剰スムージングが顕著に低減され、特徴の識別能が向上する。
  • モデルの深さと幅が増加しても性能向上が維持され、アーキテクチャスケーリングに対して頑健であることが示された。
  • ヴァニラビジョントランスフォーマーよりも優れた性能を発揮し、残差接続や畳み込み的インダクティブバイアスに依存するモデルと同等の性能を達成する。
  • コードは公開されており、訓練安定性の高いビジョントランスフォーマー分野における再現性とさらなる研究を可能にする。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。