Skip to main content
QUICK REVIEW

[論文レビュー] Three things everyone should know about Vision Transformers

Hugo Touvron, Matthieu Cord|arXiv (Cornell University)|Mar 18, 2022
Advanced Neural Network Applications被引用数 8
ひとこと要約

本稿では、ビジョントランスフォーマーのための3つの実用的改善を提示する:(1) 残差ブロックを並列化することで、精度を損なわずに訓練効率を向上させ、遅延を低減;(2) 分辨適応や転移学習のため、注意機構の層のみを微調整することで、計算量とメモリ使用量を削減;(3) マスク付き自己教師付き学習において効果的なパッチ事前処理を可能にする階層的MLPスタムを導入し、BeiTおよび教師ありベンチマークでの性能を向上。

ABSTRACT

After their initial success in natural language processing, transformer architectures have rapidly gained traction in computer vision, providing state-of-the-art results for tasks such as image classification, detection, segmentation, and video analysis. We offer three insights based on simple and easy to implement variants of vision transformers. (1) The residual layers of vision transformers, which are usually processed sequentially, can to some extent be processed efficiently in parallel without noticeably affecting the accuracy. (2) Fine-tuning the weights of the attention layers is sufficient to adapt vision transformers to a higher resolution and to other classification tasks. This saves compute, reduces the peak memory consumption at fine-tuning time, and allows sharing the majority of weights across tasks. (3) Adding MLP-based patch pre-processing layers improves Bert-like self-supervised training based on patch masking. We evaluate the impact of these design choices using the ImageNet-1k dataset, and confirm our findings on the ImageNet-v2 test set. Transfer performance is measured across six smaller datasets.

研究の動機と目的

  • ビジョントランスフォーマーにおける訓練効率と推論遅延の向上を図るアーキテクチャ的変更を検討し、精度を損なわないこと。
  • ViTをより高い解像度や新しい分類タスクに適応させる際に、注意層のみを微調整することが十分な性能を維持できるかを調査すること。
  • マスクベースの自己教師付き学習手法(例:BeiT)と互換性があり、誘導的バイアスを保持したままパッチ事前処理を効果的に行えるスタムを設計すること。
  • これらの設計選択の影響を、ImageNet-1k、ImageNet-v2、および6つの小規模データセットにおける転移学習を含む複数のベンチマークで評価すること。

提案手法

  • マルチヘッド自己注意(MHSA)とフィードフォワードネットワーク(FFN)ブロックをペアに再編集することで、並列化されたアーキテクチャを提案。これにより、同等のFLOPSとパラメータ数の下で、より広いかつ浅いネットワークが実現可能になる。
  • FFNブロックを固定し、新しい解像度や下流タスクへの適応時に注意重みのみを更新する微調整戦略を導入。
  • 複数の線形層に非線形活性化関数を適用し、パッチ集約を施す階層的MLP(hMLP)スタムを設計。これにより、パッチ間通信が生じず、自己教師付き学習におけるマスキングが保持される。
  • hMLPスタムをViTエンコーダの前段に適用し、事前処理後にマスキングを適用することで、BeiTのようなマスク自己符号化手法と互換性を確保。
  • 標準的な訓練プロトコルを採用:教師あり事前学習に300エポック、転移タスクの微調整に100エポックを設定。LayerScaleと標準的なデータオーグメンテーションも使用。
  • 線形、バッチ正規化、畳み込み、hMLPの4種類のスタム設計を比較。ImageNet-1kおよび転移ベンチマークで、同一のハイパーパramータとランダムシードを用いて評価。

実験結果

リサーチクエスチョン

  • RQ1ビジョントランスフォーマーの残差ブロックを並列化することで、精度を損なわず訓練効率と推論遅延を向上させられるか?
  • RQ2ViTの注意層のみを微調整することで、解像度の適応や転移学習において競争力ある性能を維持できるか?
  • RQ3マスクベースの自己教師付き学習(例:BeiT)と互換性を持つパッチ事前処理スタムを設計できるか、かつ性能向上が見込めるか?
  • RQ4提案されたhMLPスタムは、従来の畳み込みおよび線形スタムと比較して、精度、FLOPS、および教師あり・自己教師あり設定における一般化性能の観点でどのように差をつけるか?

主な発見

  • ViTブロックの並列化により、特に小規模バッチサイズの場合、最適化が改善され、GPU上での遅延が低下し、精度は維持またはわずかに向上する。
  • 注意層のみを微調整することで、高解像度への適応や新しい分類タスクへの適応において、完全微調整と同等の精度が達成され、計算量とメモリ使用量が削減される。
  • hMLPスタムは、BeiT事前学習下でImageNet-v2で+0.38%、ImageNet-valで+0.39%のトップ1精度向上を達成し、線形および畳み込みスタムを上回る性能を示した。
  • 教師あり学習においては、最良の畳み込みスタム(LeViT)と同等の性能を達成しながら、FLOPSは1.15倍少ない。また、パッチ間通信を回避している。
  • 従来の畳み込みスタムは、BeiT事前学習においてマスキングと干渉するため性能向上が見られなかったが、hMLPスタムはパッチ事前処理とマスク予測の両方を効果的に活用した。
  • ViT-B12と比較してFLOPSはたった0.8%増加にとどまるが、自己教師ありおよび転移学習設定で顕著な精度向上を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。