[論文レビュー] Incorporating Convolution Designs into Visual Transformers
この論文は、畳み込みのインダクティブバイアスを統合することで特徴抽出と最適化を向上させるビジョントランスフォーマー、CeiTを提案する。Image-to-Tokensモジュール、ローカル強化型フィードフォワード層、レイヤーごとのクラストークンアテンションを導入することで、大規模データや知識蒸留を必要とせず、ImageNetでSOTAの精度(384×384入力時、トップ1精度83.3%)を達成するとともに、DeiTと比較して3倍速く収束する。
Motivated by the success of Transformers in natural language processing (NLP) tasks, there emerge some attempts (e.g., ViT and DeiT) to apply Transformers to the vision domain. However, pure Transformer architectures often require a large amount of training data or extra supervision to obtain comparable performance with convolutional neural networks (CNNs). To overcome these limitations, we analyze the potential drawbacks when directly borrowing Transformer architectures from NLP. Then we propose a new extbf{Convolution-enhanced image Transformer (CeiT)} which combines the advantages of CNNs in extracting low-level features, strengthening locality, and the advantages of Transformers in establishing long-range dependencies. Three modifications are made to the original Transformer: extbf{1)} instead of the straightforward tokenization from raw input images, we design an extbf{Image-to-Tokens (I2T)} module that extracts patches from generated low-level features; extbf{2)} the feed-froward network in each encoder block is replaced with a extbf{Locally-enhanced Feed-Forward (LeFF)} layer that promotes the correlation among neighboring tokens in the spatial dimension; extbf{3)} a extbf{Layer-wise Class token Attention (LCA)} is attached at the top of the Transformer that utilizes the multi-level representations. Experimental results on ImageNet and seven downstream tasks show the effectiveness and generalization ability of CeiT compared with previous Transformers and state-of-the-art CNNs, without requiring a large amount of training data and extra CNN teachers. Besides, CeiT models also demonstrate better convergence with $3 imes$ fewer training iterations, which can reduce the training cost significantly\footnote{Code and models will be released upon acceptance.}.
研究の動機と目的
- 純粋なトランスフォーマーが小規模データセットで一般化性能に欠ける問題を、CNN由来のインダクティブバイアスを組み込むことで解決すること。
- パッチトークン化の前に低レベル特徴を抽出することで、局所性と空間相関を強化し、特徴表現を向上させること。
- トランスフォーマー構造に局所的インダクティブバイアスを埋め込むことで、学習の収束を加速すること。
- 知識蒸留や大規模事前学習に依存せずに、ImageNetおよび下流タスクで競争力ある性能を達成すること。
提案手法
- パッチトークン化の前に畳み込み層を用いて低レベル特徴を生成するImage-to-Tokens(I2T)モジュールを導入し、計算量を増加させずに特徴品質を向上させる。
- 標準的なフィードフォワードネットワークを、隣接するトークン間の空間相関を強化するための深度可分畳み込みを用いたローカル強化型フィードフォワード(LeFF)層に置き換える。
- 複数レベルの特徴を統合してクラストークン表現を精緻化する、レイヤーごとのクラストークンアテンション(LCA)機構を適用する。
- 異なるエンコーダーレイヤーの特徴を活用するマルチステージアテンション機構を採用し、最終的な分類性能を向上させる。
- I2TおよびLeFFモジュールにBatchNormとMaxプーリングを適用し、学習の安定化と性能向上を図る。
- CNN由来のインダクティブバイアスをトランスフォーマー枠組みに統合しつつ、計算効率を維持するアーキテクチャを設計する。
実験結果
リサーチクエスチョン
- RQ1畳み込みのインダクティブバイアスを統合することで、ビジョントランスフォーマーの小規模データセットにおける一般化性能が向上するか?
- RQ2生の画像パッチトークン化の代わりに特徴ベースのトークン化を採用することで、ビジョントランスフォーマーにおける特徴表現が向上するか?
- RQ3フィードフォワードモジュールに局所的インダクティブバイアスを組み込むことで、空間相関モデリングと学習安定性が向上するか?
- RQ4標準的なトランスフォーマー(例:DeiT)と比較して、提案アーキテクチャは学習コストをどの程度低減できるか?
- RQ5ハイブリッドCNN-Transformer設計が、知識蒸留や大規模事前学習に依存せずにSOTA性能を達成できるか?
主な発見
- CeiT-Sは標準的な224×224入力でImageNetでトップ1精度82.0%を達成し、ViTおよびDeiTの変種を上回る。
- 384×384解像度で微調整した場合、CeiT-Sは83.3%のトップ1精度に達し、強力な一般化性能を示す。
- CeiTモデルはDeiTと比較して3倍速く収束し、100エポックで同等の性能に到達する(DeiTは300エポックを要)。
- アブレーションスタディの結果、LeFF層におけるBatchNormと3×3のカーネルサイズが最良の性能をもたらし、ベースラインから2.2%の精度向上を実現した。
- MaxプーリングとBatchNormを備えたI2Tモジュールは他の代替手法を上回り、安定的かつ効果的な特徴抽出に不可欠であることが証明された。
- LCAモジュールはベースライン比でトップ1精度を0.6%向上させ、複数レベルの特徴統合の価値を確認した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。