[論文レビュー] CrossViT: Cross-Attention Multi-Scale Vision Transformer for Image Classification
CrossViTは、クロスアテンション機構を用いて小規模および大規模な画像パッチからの特徴を融合する二重ブランチ型Vision Transformerを提案する。これにより、マルチスケール表現学習が向上する。FLOPsとパラメータ数の増加がやや大きいものの、ImageNet1KでDeiTを2%上回る精度を達成し、優れた性能と効率性を示している。
The recently developed vision transformer (ViT) has achieved promising results on image classification compared to convolutional neural networks. Inspired by this, in this paper, we study how to learn multi-scale feature representations in transformer models for image classification. To this end, we propose a dual-branch transformer to combine image patches (i.e., tokens in a transformer) of different sizes to produce stronger image features. Our approach processes small-patch and large-patch tokens with two separate branches of different computational complexity and these tokens are then fused purely by attention multiple times to complement each other. Furthermore, to reduce computation, we develop a simple yet effective token fusion module based on cross attention, which uses a single token for each branch as a query to exchange information with other branches. Our proposed cross-attention only requires linear time for both computational and memory complexity instead of quadratic time otherwise. Extensive experiments demonstrate that our approach performs better than or on par with several concurrent works on vision transformer, in addition to efficient CNN models. For example, on the ImageNet1K dataset, with some architectural changes, our approach outperforms the recent DeiT by a large margin of 2\% with a small to moderate increase in FLOPs and model parameters. Our source codes and models are available at \url{https://github.com/IBM/CrossViT}.
研究の動機と目的
- 画像分類のためのVision Transformerにおけるマルチスケール特徴表現を向上させること。
- 効率的なクロスアテンション融合を通じて、計算コストを低減しながら性能を維持または向上させること。
- 二乗時間の複雑さを増加させることなく、小規模および大規模なパッチ特徴間の効果的な相互作用を可能にすること。
- ImageNet1Kおよびその他のベンチマークで、最新の手法と同等またはそれ以上の最先端の性能を達成すること。
- 精度と計算効率のバランスを取った軽量で効率的なアーキテクチャを提供すること。
提案手法
- モデルは、小規模パッチと大規模パッチのトークンを別々に処理する二重ブランチアーキテクチャを用い、それぞれ異なる計算複雑性を持つ。
- ブランチ間の特徴融合にクロスアテンションが用いられ、反復的なマルチモality間情報交換が可能になる。
- 各ブランチに1つのクエリトークンを用いて他方のブランチを照会することで、FLOPsおよびメモリ量の両方で線形時間にまで計算量を削減する。
- クロスアテンションモジュールが特徴融合において標準的な自己アテンションを置き換え、二乗時間の複雑さを回避する。
- 標準的な最適化手法およびデータ拡張技術を用いて、エンドツーエンドでモデルを訓練する。
- この手法はImageNet1Kに適用され、転移学習ベンチマークで評価される。
実験結果
リサーチクエスチョン
- RQ1二重ブランチのパッチ特徴間のクロスアテンションは、Vision Transformerにおけるマルチスケール表現を向上させることができるか?
- RQ2標準的な自己アテンションと比較して、効率的なクロスアテンション統合は計算複雑さを低減しながら高い性能を維持できるか?
- RQ3提案されたCrossViTは、ImageNet1KにおけるDeiTのような最先端のVision Transformerと比較してどうなるか?
- RQ4FLOPsとパラメータ数の増加がやや大きい状況でも、高い精度を達成できるか?
- RQ5二重ブランチ型のマルチスケール設計は、転移学習の設定においても一般化しやすいか?
主な発見
- CrossViTは、FLOPsとモデルパラメータ数の増加がわずか〜中程度であるにもかかわらず、ImageNet1KでDeiTを2%上回るトップ1精度を達成した。
- クロスアテンション統合機構は、線形の計算およびメモリ複雑さを達成しており、標準的な自己アテンションの二乗時間コストを回避している。
- 二重ブランチ設計はマルチスケール特徴を効果的に統合し、単一スケールや単純な連結と比較してより強力な表現を生み出している。
- 転移学習ベンチマークでも競争力のある性能を示しており、強力な一般化能力を示している。
- この研究では、効率的なクロスアテンションが、ビジョントランスフォーマーの特徴統合において自己アテンションの強力な代替手段である可能性を示している。
- アブレーションスタディの結果、二重ブランチ設計とクロスアテンション統合の両方が、性能向上に不可欠であることが確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。