Skip to main content
QUICK REVIEW

[論文レビュー] ReViT: Enhancing Vision Transformers Feature Diversity with Attention Residual Connections

Anxhelo Diko, Danilo Avola|arXiv (Cornell University)|Feb 17, 2024
CCD and CMOS Imaging Sensors被引用数 4
ひとこと要約

ReViT は、自己注意の残差接続を通じて低レベルの視覚的特徴を保持することにより、深層層における特徴の崩壊を軽減するリーマンスアテンション機構を提案する。この手法は、局所的およびグローバルなアテンションのバランスを取ることで、ImageNet1k、CIFAR100、COCO2017 における複数の画像分類および物体検出ベンチマークで性能を向上させ、最先端の結果を達成する。

ABSTRACT

Vision Transformer (ViT) self-attention mechanism is characterized by feature collapse in deeper layers, resulting in the vanishing of low-level visual features. However, such features can be helpful to accurately represent and identify elements within an image and increase the accuracy and robustness of vision-based recognition systems. Following this rationale, we propose a novel residual attention learning method for improving ViT-based architectures, increasing their visual feature diversity and model robustness. In this way, the proposed network can capture and preserve significant low-level features, providing more details about the elements within the scene being analyzed. The effectiveness and robustness of the presented method are evaluated on five image classification benchmarks, including ImageNet1k, CIFAR10, CIFAR100, Oxford Flowers-102, and Oxford-IIIT Pet, achieving improved performances. Additionally, experiments on the COCO2017 dataset show that the devised approach discovers and incorporates semantic and spatial relationships for object detection and instance segmentation when implemented into spatial-aware transformer models.

研究の動機と目的

  • 自己注意の過剰なグローバル化によって引き起こされる、深層ビジョントランスフォーマーにおける低レベルの視覚的特徴の喪失を是正すること。
  • マルチヘッド自己注意層にわたるリーマンスアテンション接続を統合することで、モデルのロバスト性と特徴の多様性を向上させること。
  • 局所的および意味的詳細を保持することにより、画像分類や物体検出などの視覚認識タスクの性能を向上させること。
  • 複雑さやクラス分布の異なる多様なデータセットにおいて、リーマンスアテンション機構の有効性を評価すること。

提案手法

  • 学習可能なゲーティング変数 α を用いて、現在の自己注意出力と過去の自己注意出力を組み合わせるリーマンスアテンション学習機構を導入する。
  • マルチヘッド自己注意(MHSA)層において、クエリおよびキー行列にリーマンス接続を適用し、浅い層から深い層への特徴伝搬を可能にする。
  • 過去と現在のアテンションマップの重み付き融合を実行:α ×(過去のアテンション)+(1−α)×(現在のアテンション)、ここで α は学習中に最適化される。
  • GradCAM 視覚化を用いて、ReViT が標準的な ViT よりもより局所的かつ多様な特徴を保持していることを示す。
  • 物体検出およびインスタンスセグメンテーションの COCO2017 における空間認識トランスフォーマー構造に対しても、リーマンスモジュールを適用する。
  • α の値を変化させたアブレーションスタディを実施し、局所的およびグローバルな特徴学習のトレードオフを分析する。
Figure 1: Illustration of feature maps learned from ReViT and ViT obtained using GradCAM [ 31 ] algorithm.
Figure 1: Illustration of feature maps learned from ReViT and ViT obtained using GradCAM [ 31 ] algorithm.

実験結果

リサーチクエスチョン

  • RQ1リーマンスアテンション学習は、ビジョントランスフォーマーにおける特徴の多様性と表現品質にどのように影響するか?
  • RQ2性能を最大化するために、過去と現在のアテンション情報(α を通じて)の最適なバランスは何か?(異なるデータセットで)
  • RQ3ReViT は、ImageNet1k、CIFAR10、CIFAR100 などの画像分類ベンチマークでどれほど性能を向上させるか?
  • RQ4空間認識トランスフォーマー構造において、意味的および空間的関係を捉えることで、ReViT は物体検出およびインスタンスセグメンテーションをどのように向上させるか?
  • RQ5オブジェクトの位置変動に対するロバスト性やインダクティブバイアスの制限について、標準的な ViT と比較して ReViT はどのように異なるか?

主な発見

  • ReViT は、精度とロバスト性の両面で標準的な ViT や他の最先端モデルを上回り、ImageNet1k で最先端の性能を達成する。
  • CIFAR100 および Oxford Flowers-102 では、α = 0.75 でピーク性能を記録し、α が 1 に近づくと急激に精度が低下する。これは、過去のアテンションの重要性を示している。
  • Oxford-IIIT Pet データセットでは、α を最適にチューニングした場合、クラス内およびクラス間の変動をよりよく処理できることから、顕著な性能向上が見られる。
  • COCO2017 では、空間認識トランスフォーマーにおいて、意味的および空間的関係を発見・統合することで、物体検出およびインスタンスセグメンテーションの性能が向上する。
  • アブレーションスタディの結果、α = 0(最初の層のアテンションにのみ依存)では、特に複雑なデータセットにおいて性能の崩壊が生じることを確認し、リーマンスアテンションの必要性を裏付けた。
  • GradCAM 視覚化により、ReViT が標準的な ViT よりも、特に深層部においてより局所的かつ多様な特徴を保持していることが確認された。これは、特徴の崩壊が軽減されていることを示している。
Figure 2: Illustration of the standard self-attention (a) and the proposed mechanism with residual attention module (b).
Figure 2: Illustration of the standard self-attention (a) and the proposed mechanism with residual attention module (b).

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。