[論文レビュー] MAFormer: A Transformer Network with Multi-scale Attention Fusion for Visual Recognition
MAFormerは、マルチスケールアテンションフェージョン(MAF)を備えたデュアルストリームTransformerアーキテクチャを提案する。このアーキテクチャは、窓アテンションを用いた局所的な細粒度特徴と、新しいダウンサンプリングを伴うグローバルラーニング(GLD)モジュールを用いたグローバルな粗粒度特徴を同時に学習し、アテンションを介して動的に統合する。この手法は最先端の性能を達成し、ImageNetではTop-1精度85.9%を記録し、パラメータ数が同程度のCSWin や LV-ViT よりもオブジェクト検出およびインスタンスセグメンテーションのタスクで優れた性能を発揮する。
Vision Transformer and its variants have demonstrated great potential in various computer vision tasks. But conventional vision transformers often focus on global dependency at a coarse level, which suffer from a learning challenge on global relationships and fine-grained representation at a token level. In this paper, we introduce Multi-scale Attention Fusion into transformer (MAFormer), which explores local aggregation and global feature extraction in a dual-stream framework for visual recognition. We develop a simple but effective module to explore the full potential of transformers for visual representation by learning fine-grained and coarse-grained features at a token level and dynamically fusing them. Our Multi-scale Attention Fusion (MAF) block consists of: i) a local window attention branch that learns short-range interactions within windows, aggregating fine-grained local features; ii) global feature extraction through a novel Global Learning with Down-sampling (GLD) operation to efficiently capture long-range context information within the whole image; iii) a fusion module that self-explores the integration of both features via attention. Our MAFormer achieves state-of-the-art performance on common vision tasks. In particular, MAFormer-L achieves 85.9$\%$ Top-1 accuracy on ImageNet, surpassing CSWin-B and LV-ViT-L by 1.7$\%$ and 0.6$\%$ respectively. On MSCOCO, MAFormer outperforms the prior art CSWin by 1.7$\%$ mAPs on object detection and 1.4$\%$ on instance segmentation with similar-sized parameters, demonstrating the potential to be a general backbone network.
研究の動機と目的
- 従来のビジョントランスフォーマーが同時に細粒度の局所的依存関係と長距離のグローバル依存関係を捉えることの制限を解消すること。
- ハイブリッドモデルにおける畳み込みと自己アテンションの間の不適合性とトレーニングの曖昧性を克服すること。
- 局所的およびグローバルな特徴をトークンレベルで効果的に統合できる統一的かつエンドツーエンドでトレーニング可能なフレームワークを設計すること。
- 既存のビジョントランスフォーマーやCNNよりも優れた性能を示す汎用バックボーンを構築すること。
- 標準的な自己アテンションの2乗の計算量を伴わない効率的な長距離コンテキストモデリングを可能にすること。
提案手法
- 局所的な窓アテンションブランチを用いた短距離特徴集約のための、2本の並列ストリームを持つマルチスケールアテンションフェージョン(MAF)ブロックを導入する。
- 入力画像全体からダウンサンプリングと自己アテンションを用いて長距離コンテキストを捉える、ダウンサンプリングを伴うグローバルラーニング(GLD)モジュールを提案する。
- グローバルストリームでトークンレベルの空間的位置情報を符号化するために、位置埋め込みを採用する。
- 両方の表現の共適応的トレーニングを可能にする、学習可能なアテンションベースの統合モジュールを通じて、局所的およびグローバルな特徴を統合する。
- MAFブロックを初期段階で使用し、深層部では標準的なアテンションを用いるデュアルストリームアーキテクチャを採用する。
- 追加のモジュールや複雑な演算を用いず、アテンションベースの統合に依存する、シンプルでパラメータ効率の良い設計を採用する。

実験結果
リサーチクエスチョン
- RQ1デュアルストリームトランスフォーマーは、視覚認識の向上を図るために、トークンレベルで局所的およびグローバルな表現を効果的に学習・統合できるか?
- RQ2提案されたダウンサンプリングを伴うグローバルラーニング(GLD)モジュールは、計算効率を維持した上で効率的な長距離コンテキストモデリングを可能にするか?
- RQ3マルチスケールアテンションフェージョン(MAF)機構は、標準的な自己アテンションや後段統合戦略と比較して、特徴表現をどのように向上させるか?
- RQ4MAFormerは、オブジェクト検出やインスタンスセグメンテーションなどの密度予測タスクにおいて、既存のビジョントランスフォーマーやCNNをどの程度上回るか?
- RQ5MAFormerは、自己教師あり事前学習を目的とした視覚タスクにおける強力で汎用的なバックボーンとして機能できるか?
主な発見
- MAFormer-LはImageNetで85.9%のTop-1精度を達成し、CSWin-Bを1.7%、LV-ViT-Lを0.6%上回った。
- MSCOCOオブジェクト検出では、MAFormer-Bが49.6%のボックスmAPを達成し、パラメータ数が同程度のCSWinを1.7%上回った。
- MSCOCOインスタンスセグメンテーションでは、MAFormer-Bが49.6%のマスクmAPを達成し、同じ設定下でCSWinを1.4%上回った。
- UPerNetを用いたADE20Kセマンティックセグメンテーションでは、MAFormer-Bが51.1%のmIoUおよび51.6%のMS mIoUを達成し、Swin-Baseをそれぞれ3.0ポイントおよび2.5ポイント上回った。
- Semantic FPNを用いたADE20Kでは、MAFormer-Sが47.9%のmIoUを達成し、Swin-Tを6.4ポイント上回った。
- 1xトレーニングスケジュールでさえも、MAFormerのバリエーションはすべてのベンチマークで先行SOTAモデルを一貫して上回り、優れた一般化性能とスケーラビリティを示した。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。