[論文レビュー] Vision Transformer with Deformable Attention
本稿では、Deformable Attention Transformer (DAT) を提案する。これは、各クエリグループごとに共有されるオフセットを介してデータに依存するキーバリューのサンプリング位置を学習する、画期的な可変自己注意メカニズムを備えたビジョントランスフォーマーバックボーンである。この機構により、効率的で適応的な注意が可能となり、Swin Transformer や他の強力なベースラインと比較して、ImageNet でトップ-1精度を 0.7% 向上、ADE20K のセマンティックセグメンテーションで 1.2%、COCO のオブジェクト検出で 1.1% の向上を達成した。
Transformers have recently shown superior performances on various vision tasks. The large, sometimes even global, receptive field endows Transformer models with higher representation power over their CNN counterparts. Nevertheless, simply enlarging receptive field also gives rise to several concerns. On the one hand, using dense attention e.g., in ViT, leads to excessive memory and computational cost, and features can be influenced by irrelevant parts which are beyond the region of interests. On the other hand, the sparse attention adopted in PVT or Swin Transformer is data agnostic and may limit the ability to model long range relations. To mitigate these issues, we propose a novel deformable self-attention module, where the positions of key and value pairs in self-attention are selected in a data-dependent way. This flexible scheme enables the self-attention module to focus on relevant regions and capture more informative features. On this basis, we present Deformable Attention Transformer, a general backbone model with deformable attention for both image classification and dense prediction tasks. Extensive experiments show that our models achieve consistently improved results on comprehensive benchmarks. Code is available at https://github.com/LeapLabTHU/DAT.
研究の動機と目的
- 標準のビジョントランスフォーマーおよびスパース注意メカニズム(例:Swin Transformer)における非効率さと最適でない注意分布の問題に取り組むこと。
- 関連する特徴を無視したり、不関係な特徴を保持したりする可能性がある、データに依存しない注意パターンの限界を克服すること。
- 計算複雑度が二次的に増加しないように、入力コンテンツに適応する微分可能で効率的な可変注意メカニズムを導入すること。
- 分類および密度予測タスクの両方で、既存のビジョントランスフォーマーを一貫して上回る、一般用途向けの畳み込みフリーなバックボーンモデルを設計すること。
提案手法
- クエリ特徴から生成される学習可能なオフセットを介して、キーやバリューの位置をシフトさせる可変自己注意モジュールを提案する。これにより、データに依存する注意が可能になる。
- クエリに依存しない共有オフセットを、グループ内のすべてのクエリに適用することで、メモリと計算コストを削減しながらも柔軟性を維持する。
- 均一な参照ポイントを初期のサンプリング位置として用い、その後、クエリ特徴に条件付けられたオフセットネットワークによって変形する。
- クエリに応じて各参照ポイントのシフトを予測する軽量なオフセットネットワークを採用し、顕著な領域に動的に注目できるようにする。
- 画像分類および密度予測タスクの両方に適した、ピラミッド形状のバックボーン、Deformable Attention Transformer (DAT) を構築する。
- 各クエリごとのオフセット学習を避けることで、可変畳み込みや従来のトランスフォーマーにおける可変注意と異なり、線形の空間計算量を維持する。
実験結果
リサーチクエスチョン
- RQ1データに依存する注意メカニズムは、計算効率を保ちつつ、ビジョントランスフォーマーにおける特徴表現を向上させることができるか?
- RQ2キーバリューのサンプリングに、クエリに依存しない共有オフセットを学習する方法は、クエリ固有のものや固定パターンの注意と比較して、性能と効率の面でどのように異なるか?
- RQ3可変注意は、画像認識タスクにおける長距離依存関係やオブジェクト固有の特徴をどの程度向上させるか?
- RQ4畳み込み部品を追加せずに、純粋なトランスフォーマーバックボーンに可変注意メカニズムを効果的に統合できるか?
主な発見
- DAT は ImageNet-1K で 82.0% のトップ-1精度を達成し、類似した FLOPs とパラメータ数の条件下で Swin Transformer よりも 0.7% 高い。
- ADE20K セマンティックセグメンテーションベンチマークでは、競合ベースラインより mIoU を 1.2% 向上させた。特に小規模および大規模オブジェクトに対して顕著な改善(最大 2.1%)を示した。
- COCO オブジェクト検出タスクでは、Swin Transformer と比較してボックス AP とマスク AP の両方で 1.1% 向上し、検出とセグメンテーションの両タスクで一貫した向上を示した。
- 畳み込みパッチエンベッディングを用いたモデル(DAT-T*)は、ImageNet で 82.7% のトップ-1精度を達成し、元の DAT-T よりも 0.7% 向上し、最良のベースラインよりも 0.7% 高かった。
- 可視化結果から、可変注意は前面オブジェクトや幾何学的に複雑な領域(例:複数のドーナツやキリン)に注目しているのに対し、Swin Transformer は局所的で関係の薄いパッチに注目する傾向にあることが確認された。
- メモリと FLOP の分析から、DAT は類似したキーカウントを持つ D-DETR よりも 2.6倍少ないメモリ、1.3倍少ない FLOPs を使用しながら、より高い精度を達成した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。