Skip to main content
QUICK REVIEW

[論文レビュー] Dynamic Group Transformer: A General Vision Transformer Backbone with Dynamic Group Attention

Kai Liu, Tianyi Wu|arXiv (Cornell University)|Mar 8, 2022
Advanced Image and Video Retrieval Techniques被引用数 4
ひとこと要約

本論文は、固定ウィンドウ自己注意機構を動的グループ注意(DG-Attention)に置き換える一般化ビジョンTransformerバックボーンであるDynamic Group Transformer(DGT)を提案する。DG-Attentionは、コンテント類似度に基づいてクエリを動的にグループ化し、各グループに対して関連するキー/バリューを選択する。この手法は、画像分類、セマンティックセグメンテーション、オブジェクト検出、インスタンスセグメンテーションの全分野で最先端性能を達成し、DGT-TはImageNet-1kで83.8%のTop-1精度を達成し、DGT-Bは85.0%のTop-1精度を達成した。

ABSTRACT

Recently, Transformers have shown promising performance in various vision tasks. To reduce the quadratic computation complexity caused by each query attending to all keys/values, various methods have constrained the range of attention within local regions, where each query only attends to keys/values within a hand-crafted window. However, these hand-crafted window partition mechanisms are data-agnostic and ignore their input content, so it is likely that one query maybe attends to irrelevant keys/values. To address this issue, we propose a Dynamic Group Attention (DG-Attention), which dynamically divides all queries into multiple groups and selects the most relevant keys/values for each group. Our DG-Attention can flexibly model more relevant dependencies without any spatial constraint that is used in hand-crafted window based attention. Built on the DG-Attention, we develop a general vision transformer backbone named Dynamic Group Transformer (DGT). Extensive experiments show that our models can outperform the state-of-the-art methods on multiple common vision tasks, including image classification, semantic segmentation, object detection, and instance segmentation.

研究の動機と目的

  • 固定ウィンドウ自己注意機構の限界に取り組むこと。この機構はデータに依存せず、不要なキー/バリューに注目する可能性がある。
  • グローバル自己注意の二次的計算複雑度を低減しつつ、長距離依存性のモデリングを維持すること。
  • 空間的制約なしに、柔軟でコンテント依存の注意機構を開発し、クエリを動的にグループ化し、関連するキー/バリューを選択すること。
  • 多様なビジョンタスクで競争力のある性能を発揮する汎用ビジョンTransformerバックボーンを設計すること。

提案手法

  • 動的グループ注意(DG-Attention)は、学習済みのクラスターセンタロイドに基づいてクエリを類似度に応じて動的にグループ化し、コンテントに適応したグループ化を可能にする。
  • 各グループに対して、そのクラスターセンタロイドを用いて全セットから最も関連性の高いキー/バリューのサブセットを選択することで、不要な注目を低減する。
  • 選択されたキーが局所的ウィンドウに限定されないよう、特徴マップ全体に散らばる可能性があるため、空間的制約を回避する。
  • グループ化機構は微分可能であり、エンドツーエンドで訓練可能であり、クラスタリングと注目を同時に最適化可能である。
  • 各グループの注目範囲を制限し、グループ別行列乗算を用いることで、計算効率を維持する。
  • DGTバックボーンは、2400万、5200万、9000万パラメータを有する変種(DGT-T、DGT-S、DGT-B)にスケーリングされ、多様な展開ニーズに対応する。

実験結果

リサーチクエスチョン

  • RQ1入力依存のクエリグループ化に基づいて関連するキーを動的に選択することで、コンテントに適応する注目機構が、固定ウィンドウ自己注意機構を上回ることができるか?
  • RQ2クエリの動的グループ化は、高解像度特徴マップにおける長距離依存性を維持しつつ、計算コストを低減できるか?
  • RQ3動的グループ化を備えた汎用ビジョンTransformerバックボーンが、多様なビジョンタスクで最先端性能を達成できるまでの程度は?
  • RQ4キー選択に空間的制約がないことで、非局所的で意味的に関連する特徴のモデリングが向上するか?

主な発見

  • DGT-TはImageNet-1kで83.8%のTop-1精度を達成し、画像分類分野で既存のSOTA手法を上回った。
  • ADE20Kデータセットでは、DGT-Tはセマンティックセグメンテーションで50.2%のmIoUを達成し、既存手法を上回った。
  • COCOにおけるオブジェクト検出では、DGT-Tは47.7%のボックスmAPを達成し、密度の高い予測タスクへの強力な一般化能力を示した。
  • DGT-BはImageNet-1kで85.0%のTop-1精度、ADE20Kで51.2%のmIoUを達成し、分類とセグメンテーションの両分野で新記録を樹立した。
  • 可視化結果から、異なるクエリグループが局所的ウィンドウに制限されず、散らばった意味的に関連するキーに注目していることが確認された。
  • 提案されたグループ別行列乗算の実装により、グローバルメモリ使用量を削減し、効率的なGPU計算が可能となり、スケーラブルなトレーニングと推論を支援した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。