[論文レビュー] A Close Look at Spatial Modeling: From Attention to Convolution
本稿では、自己注意から照応関係のないグローバルコンテキストを抽出し、それを畳み込み層に動的に統合する完全畳み込み型ビジョントランスフォーマー、FCViTを提案する。これにより、パラメータ数を減らしながら最先端の性能を達成する。FCViT-S12はImageNet-1Kで80.9%のtop-1精度を達成し、ResT-Liteを3.7%上回り、パラメータ数を減らしたままConvNeXtを上回る性能を示した。
Vision Transformers have shown great promise recently for many vision tasks due to the insightful architecture design and attention mechanism. By revisiting the self-attention responses in Transformers, we empirically observe two interesting issues. First, Vision Transformers present a queryirrelevant behavior at deep layers, where the attention maps exhibit nearly consistent contexts in global scope, regardless of the query patch position (also head-irrelevant). Second, the attention maps are intrinsically sparse, few tokens dominate the attention weights; introducing the knowledge from ConvNets would largely smooth the attention and enhance the performance. Motivated by above observations, we generalize self-attention formulation to abstract a queryirrelevant global context directly and further integrate the global context into convolutions. The resulting model, a Fully Convolutional Vision Transformer (i.e., FCViT), purely consists of convolutional layers and firmly inherits the merits of both attention mechanism and convolutions, including dynamic property, weight sharing, and short- and long-range feature modeling, etc. Experimental results demonstrate the effectiveness of FCViT. With less than 14M parameters, our FCViT-S12 outperforms related work ResT-Lite by 3.7% top1 accuracy on ImageNet-1K. When scaling FCViT to larger models, we still perform better than previous state-of-the-art ConvNeXt with even fewer parameters. FCViT-based models also demonstrate promising transferability to downstream tasks, like object detection, instance segmentation, and semantic segmentation. Codes and models are made available at: https://github.com/ma-xu/FCViT.
研究の動機と目的
- ビジョントランスフォーマーにおける自己注意の限界、特に深層部におけるスパarsenessおよび照応関係のない注意マップの挙動を調査すること。
- 長距離依存関係を捉えるグローバルコンテキストを抽出することで、注意機構の非効率性と冗長性を是正すること。
- このグローバルコンテキストを畳み込み層に統合し、局所的特徴モデリングを強化するとともに、動的で注意に類似した挙動を維持すること。
- 重み共有、動的モデリング、長距離特徴学習といったトランスフォーマーとConvNetsの長所を併せ持つ完全畳み込みアーキテクチャを構築すること。
- 画像分類、物体検出、インスタンスセグメンテーション、セマンティックセグメンテーションといったタスクで優れた性能と移行性を示すこと。
提案手法
- 著者らは、クエリ依存の定式化を緩和することで、自己注意からグローバルコンテキストを抽出し、すべてのトークンに共通する照応関係のない共有コンテキストを生成する。
- このグローバルコンテキストは、学習可能なゲーティング機構を介して局所的畳み込み演算に動的に統合され、長距離特徴と局所特徴の適応的統合を可能にする。
- チャネルグループ間の多群トークン-グローバル類似度を導入することで、グループ間の多様性を保ち、均一な注意パターンへの崩壊を防ぐ。
- アーキテクチャは完全畳み込み型であり、ディープワイド分離畳み込みと、注意ヘッドを置き換えるグローバルコンテキストインジェクションモジュールを採用する。
- 標準的なImageNet-1K分類の事前学習を実施後、標準的な検出およびセグメンテーションフレームワークを用いて下流タスクでの微調整を実施する。
- 競争的な情報ボトルネックを適用することで、グローバルコンテキスト学習中に冗長な特徴をフィルタリングし、表現能力を向上させる。
実験結果
リサーチクエスチョン
- RQ1なぜ深層部におけるビジョントランスフォーマーの自己注意マップは、照応関係のないスパースな挙動を示すのか?これは意図された動的でクエリ固有の注意の本質を損なう。
- RQ2自己注意から抽出されたグローバルコンテキストを効果的に抽象化し、再利用することで、局所的畳み込み特徴学習を向上させられるか?
- RQ3注意ヘッドを畳み込み層に置き換えた場合でも、注意の動的で長距離モデリング特性をどのように維持できるか?
- RQ4完全畳み込みアーキテクチャは、既存の最先端モデルよりも少ないパラメータ数で、視覚ベンチマークで最先端の性能を達成できるか?
- RQ5グローバルコンテキストと局所畳み込みの統合により、物体検出やセマンティックセグメンテーションといった下流タスクへの移行性が向上するか?
主な発見
- FCViT-S12は、わずか14MパラメータでImageNet-1Kで80.9%のtop-1精度を達成し、ResT-Liteを3.7%上回った。
- より大きなサイズにスケーリングしても、FCViT-B24はADE20Kセマンティックセグメンテーションで45.5%のmIoUを達成し、25.3Mパラメータで、Twins-PCPVT-Sを1.2%上回り、パラメータ数を減らした状態で優れた性能を示した。
- MS COCO 2017物体検出タスクでは、FCViT-Tinyがパラメータ数を減らしたにもかかわらず、PoolFormer-S12より5.0 mAP^boxおよび4.0 mAP^mask高い性能を示した。
- グローバルコンテキストの抽象化により、注意のスパarsityが効果的に低減され、クエリ無関係性が解消されたことが、ImageNet-1Kにおける可視化と統計的分析で確認された。
- FCViTは優れた移行性を示し、インスタンスセグメンテーションおよびセマンティックセグメンテーションタスクで、先行手法を一貫して上回る性能を達成した。
- 多群類似度機構により、注意ヘッドの崩壊が防止され、特徴表現における多様性が維持され、モデルの表現能力が向上した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。