Skip to main content
QUICK REVIEW

[論文レビュー] DaViT: Dual Attention Vision Transformers

Mingyu Ding, Bin Xiao|arXiv (Cornell University)|Apr 7, 2022
Advanced Neural Network Applications被引用数 11
ひとこと要約

DaViTは、視覚変換器に二重自己注意メカニズムを導入し、局所的な細粒度表現とグローバルな文脈表現を同時に効率的に捉える。空間トークンと転置されたチャネルトークンの両方に対して自己注意を適用し、トークンをグループ化することで、シーケンス長に対して線形な計算複雑性を維持する。これにより、87.9MパラメータでImageNet-1Kで84.6%のトップ1精度を達成し、最先端の性能を発揮しながらも、計算効率を維持している。

ABSTRACT

In this work, we introduce Dual Attention Vision Transformers (DaViT), a simple yet effective vision transformer architecture that is able to capture global context while maintaining computational efficiency. We propose approaching the problem from an orthogonal angle: exploiting self-attention mechanisms with both "spatial tokens" and "channel tokens". With spatial tokens, the spatial dimension defines the token scope, and the channel dimension defines the token feature dimension. With channel tokens, we have the inverse: the channel dimension defines the token scope, and the spatial dimension defines the token feature dimension. We further group tokens along the sequence direction for both spatial and channel tokens to maintain the linear complexity of the entire model. We show that these two self-attentions complement each other: (i) since each channel token contains an abstract representation of the entire image, the channel attention naturally captures global interactions and representations by taking all spatial positions into account when computing attention scores between channels; (ii) the spatial attention refines the local representations by performing fine-grained interactions across spatial locations, which in turn helps the global information modeling in channel attention. Extensive experiments show our DaViT achieves state-of-the-art performance on four different tasks with efficient computations. Without extra data, DaViT-Tiny, DaViT-Small, and DaViT-Base achieve 82.8%, 84.2%, and 84.6% top-1 accuracy on ImageNet-1K with 28.3M, 49.7M, and 87.9M parameters, respectively. When we further scale up DaViT with 1.5B weakly supervised image and text pairs, DaViT-Gaint reaches 90.4% top-1 accuracy on ImageNet-1K. Code is available at https://github.com/dingmyu/davit.

研究の動機と目的

  • 視覚変換器におけるグローバル文脈モデリングと計算効率のトレードオフを解消すること。
  • 空間解像度の二乗に比例しない複雑さで、グローバルな長距離依存関係を捉えるメカニズムを設計すること。
  • 空間的自己注意とチャネル的自己注意の相補的な役割が表現学習をどのように向上させるかを調査すること。
  • 二重自己注意が、より少ないパラメータ数とFLOPsで、標準的な局所的またはグローバルな自己注意を上回ることを示すこと。
  • フィードフォワードネットワーク(FFNs)を排除し、より深いアテンションオンativeアーキテクチャを採用した場合の有効性を評価すること。

提案手法

  • 空間トークン(パッチベース)とチャネルトークン(特徴ベース)の2種類のトークンを導入し、チャネル次元に沿った自己注意により、グローバルな画像文脈をモデル化する。
  • 特徴マップを転置して自己注意を適用し、各チャネルトークンが全空間的位置をカバーするグローバルな視点を表す。
  • シーケンス次元に沿って空間的およびチャネル的トークンをグループ化することで、シーケンス長に対して線形な計算複雑性を維持する。
  • 二重自己注意ブロック内で、空間ウィンドウ自己注意とチャネルグループ自己注意を交互に適用し、局所的およびグローバル表現を精緻化する。
  • FFNsを排除し、FLOP予算を満たすために、より深い二重自己注意ブロックのスタックを採用することで、軽量でパラメータ効率の良い設計を実現する。
  • クエリとキーをグループ化することで、計算コストを低減しつつもグローバルモデリング能力を保持する、チャネルグループ自己注意を採用する。

実験結果

リサーチクエスチョン

  • RQ1空間的およびチャネル的自己注意を統合的にモデリングすることで、計算コストを増加させずにグローバル文脈モデリングを向上させることができるか?
  • RQ2二重自己注意は、標準的なウィンドウ自己注意やグローバル自己注意と比べて、精度と効率の両面で優れているか?
  • RQ3フィードフォワードネットワーク(FFNs)を排除した純粋なアテンションアーキテクチャは、画像分類タスクで強力な性能を発揮できるか?
  • RQ4グローバルな特徴表現に基づいて動作するチャネル自己注意は、SE や ECA といった従来のチャネルアテンションモジュールを上回るか?
  • RQ5二重自己注意メカニズムは、最先端の性能に到達するためのレイヤー数をどの程度削減できるか?

主な発見

  • DaViT-Baseは、87.9Mパラメータと15.2 GFLOPsでImageNet-1Kで84.6%のトップ1精度を達成し、同程度のFLOPレベルの先行研究を上回っている。
  • DaViT-Tinyは、28.3Mパラメータと4.5 GFLOPsでImageNet-1Kで82.8%のトップ1精度を達成し、高い効率-精度トレードオフを示している。
  • FFNsを排除した純粋なアテンションアーキテクチャのDaViTバージョンは、ImageNet-1Kで82.5%のトップ1精度を達成し、ウィンドウ自己注意およびチャネル自己注意のベースラインを1.5–1.7%上回っている。
  • 1.5Bの弱教師付き画像テキストペairで事前学習されたDaViT-Giantは、ImageNet-1Kで90.4%のトップ1精度に達し、強力なスケーラビリティを示している。
  • DaViTモデルは、例えばV100上でTinyモデルで1059 vs. 1024サンプル/秒のスループットを達成し、Swin Transformerよりも高い推論効率を示している。
  • チャネル自己注意をSEやECAブロックに置き換えると、精度が1.6%低下するため、提案されたアテンションメカニズムがグローバル特徴統合に優れていることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。