Skip to main content
QUICK REVIEW

[論文レビュー] SG-Former: Self-guided Transformer with Evolving Token Reallocation

Sucheng Ren, Xingyi Yang|arXiv (Cornell University)|Aug 23, 2023
Advanced Neural Network Applications被引用数 4
ひとこと要約

SG-Formerは、自己ガイド付きの変化するトークン再割り当てを備えた自己注意機構を導入し、顕著な画像領域に対してより多くのトークンを割り当てて細粒度の注目を可能にするとともに、重要度の低い領域ではトークンを減らしてグローバルなコンテキストと効率性を維持する。ハイブリッドスケール自己注意から得られる重要度マップを訓練中に進化させることで、FLOPsとパラメータ数を削減しながら最先端の性能を達成し、ImageNet-1KではTop-1精度84.7%を達成。Swin Transformerを+1.3%の精度および+3 mIoUで上回った。

ABSTRACT

Vision Transformer has demonstrated impressive success across various vision tasks. However, its heavy computation cost, which grows quadratically with respect to the token sequence length, largely limits its power in handling large feature maps. To alleviate the computation cost, previous works rely on either fine-grained self-attentions restricted to local small regions, or global self-attentions but to shorten the sequence length resulting in coarse granularity. In this paper, we propose a novel model, termed as Self-guided Transformer~(SG-Former), towards effective global self-attention with adaptive fine granularity. At the heart of our approach is to utilize a significance map, which is estimated through hybrid-scale self-attention and evolves itself during training, to reallocate tokens based on the significance of each region. Intuitively, we assign more tokens to the salient regions for achieving fine-grained attention, while allocating fewer tokens to the minor regions in exchange for efficiency and global receptive fields. The proposed SG-Former achieves performance superior to state of the art: our base size model achieves extbf{84.7\%} Top-1 accuracy on ImageNet-1K, extbf{51.2mAP} bbAP on CoCo, extbf{52.7mIoU} on ADE20K surpassing the Swin Transformer by extbf{+1.3\% / +2.7 mAP/ +3 mIoU}, with lower computation costs and fewer parameters. The code is available at \href{https://github.com/OliverRensu/SG-Former}{https://github.com/OliverRensu/SG-Former}

研究の動機と目的

  • 高解像度特徴マップにおけるビジョントランスフォーマーの2次関数的計算コストを軽減すること。
  • グローバル受容場を損なわず、計算コストを増加させることなく、細粒度のグローバル自己注意を可能にすること。
  • 領域の重要度に基づいて動的にトークンを再割り当てし、顕著な領域での表現品質を向上させること。
  • 手動で設計されたトークン集約戦略への依存を減らし、エンドツーエンドで重要度マップを学習すること。
  • 一様な自己注意機構内で局所的およびグローバルな注目を統合し、適応的な粒度を実現すること。

提案手法

  • モデルはハイブリッドスケール自己注意を用いて、1層内で複数の粒度の特徴を抽出し、注目ヘッドをグループ化して局所的およびグローバルなパターンを捉える。
  • ハイブリッドスケール注目出力から重要度マップを推定し、その重要度に基づいて顕著な画像領域を特定する。
  • 重要度マップに基づいてトークンを再割り当てする:顕著な領域にはより多くのトークンを割り当てて細粒度の相互作用を可能にし、背景領域には少ないトークンを割り当てて効率性を確保する。
  • 重要度マップは訓練中に進化するため、自己ガイド付きで適応的な再割り当てが可能となり、画像固有かつデータ駆動的になる。
  • キーとバリューのトークンは再割り当てされるが、クエリトークンは固定されたまま維持され、動的トークン分布を有効に活用した効率的なグローバル自己注意が実現される。
  • 長距離依存性を全体の特徴マップに保持しつつ、意味的に重要な領域に計算リソースを集中させる。

実験結果

リサーチクエスチョン

  • RQ1自己注意機構は、顕著な領域に動的にトークンを再割り当てすることで、グローバルコンテキストを保ちながら細粒度の表現を向上させることができるか?
  • RQ2ハイブリッドスケール自己注意は、トークン再割り当てのためのより正確な重要度マップ推定にどのように寄与するか?
  • RQ3自己ガイド付きで進化するトークン再割り当ては、固定または均一なトークン集約戦略に比べて、精度および効率性において優れているか?
  • RQ4適応的トークン割り当ては、高解像度特徴マップにおける計算コストを削減しながらも、グローバル受容場を維持できるか?
  • RQ5局所的、グローバル的、またはハイブリッドスケールの注目から得られる重要度マップを用いることで、モデル性能にどのような影響を与えるか?

主な発見

  • SG-FormerはImageNet-1Kで84.7%のTop-1精度を達成し、Swin Transformerを+1.3%上回った。
  • COCOオブジェクト検出では51.2 mAP bbAPを達成し、Swin Transformerを+2.7 mAP上回った。
  • ADE20Kセマンティックセグメンテーションでは52.7 mIoUを達成し、Swin Transformerを+3 mIoU上回った。
  • ベースモデルでは、Swin Transformerと比較してFLOPsとパラメータ数を削減しながら性能を向上させた。
  • アブレーションスタディの結果、ハイブリッドスケールの重要度マップは、局所的・グローバル的または手動で定義されたマップを上回り、+0.9のTop-1精度向上を示した。
  • Semantic FPNを用いることで、SG-FormerはADE20Kで50.6 mIoUを達成し、パラメータ数を10%削減しながらSwinを4.6 mIoU上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。