Skip to main content
QUICK REVIEW

[論文レビュー] ViTAEv2: Vision Transformer Advanced by Exploring Inductive Bias for Image Recognition and Beyond

Qiming Zhang, Yufei Xu|arXiv (Cornell University)|Feb 21, 2022
Advanced Neural Network Applications被引用数 11
ひとこと要約

本稿では、局所性およびスケール不変性のための明示的な帰納的バイアスを組み込んだ、ViTAEv2というビジョントランスフォーマーのアーキテクチャを提案する。特化した縮小セルと正規セルを用い、それらを等方的およびマルチステージ構成で積み重ねることで、プライベートデータを一切使用せずにImageNetで88.5%のTop-1精度、ImageNet-Realで91.2%の精度を達成し、最先端性能を実現した。これは、帰納的バイアスが大規模なモデルでもデータ効率性と一般化性能を向上させることを示している。

ABSTRACT

Vision transformers have shown great potential in various computer vision tasks owing to their strong capability to model long-range dependency using the self-attention mechanism. Nevertheless, they treat an image as a 1D sequence of visual tokens, lacking an intrinsic inductive bias (IB) in modeling local visual structures and dealing with scale variance, which is instead learned implicitly from large-scale training data with longer training schedules. In this paper, we propose a Vision Transformer Advanced by Exploring intrinsic IB from convolutions, i.e., ViTAE. Technically, ViTAE has several spatial pyramid reduction modules to downsample and embed the input image into tokens with rich multi-scale context using multiple convolutions with different dilation rates. In this way, it acquires an intrinsic scale invariance IB and can learn robust feature representation for objects at various scales. Moreover, in each transformer layer, ViTAE has a convolution block parallel to the multi-head self-attention module, whose features are fused and fed into the feed-forward network. Consequently, it has the intrinsic locality IB and is able to learn local features and global dependencies collaboratively. The proposed two kinds of cells are stacked in both isotropic and multi-stage manners to formulate two families of ViTAE models, i.e., the vanilla ViTAE and ViTAEv2. Experiments on the ImageNet dataset as well as downstream tasks on the MS COCO, ADE20K, and AP10K datasets validate the superiority of our models over the baseline transformer models and concurrent works. Besides, we scale up our ViTAE model to 644M parameters and obtain the state-of-the-art classification performance, i.e., 88.5% Top-1 classification accuracy on ImageNet validation set and the best 91.2% Top-1 accuracy on ImageNet real validation set, without using extra private data.

研究の動機と目的

  • ビジョントランスフォーマーに内在する帰納的バイアスの欠如に起因する、大規模データに依存して局所構造やスケール不変性を暗黙的に学習する必要性を是正すること。
  • トランスフォーマーのアーキテクチャに内在的な帰納的バイアスを埋め込むことで、データ効率性と収束速度の向上を図ること。
  • 画像分類およびオブジェクト検出、セマンティックセグメンテーション、ヒューマンポーズ推定などの下流ビジョンタスクにおける性能向上を図ること。
  • 大規模ビジョントランスフォーマーモデルにおいても、帰納的バイアスが依然として有効であるかどうかを検証すること。

提案手法

  • 二種類の新しいセルタイプを導入:マルチスケール特徴抽出のための縮小セルと、局所的特徴モデリングのための正規セル。
  • 畳み込みと自己注意モジュールがセル内ですべて並列に動作するスケルトン接続アーキテクチャを採用し、相補的な特徴学習を可能にする。
  • 等方的およびマルチステージ構成の両方で縮小セルと正規セルを積み重ね、2つのファミリー(ヴァニラViTAEとViTAEv2)を構築する。
  • マルチ受容 field 異常畳み込みを用いた Tokens-to-Token 変換機構を採用し、視覚的トークンにスケール不変特徴を埋め込む。
  • ViTAEv2では階層的設計を採用し、複数の段階にわたり段階的に特徴を構築することで、CNNのマルチスケール階層性を模倣する。
  • 空間構造を保持しながらシーケンス長を短縮する動的トークンマージ戦略を採用し、計算効率を向上させる。

実験結果

リサーチクエスチョン

  • RQ1局所性およびスケール不変性のための明示的帰納的バイアスが、大規模データに依存せずにビジョントランスフォーマーの性能を向上させることができるか?
  • RQ2同じセル内に畳み込みモジュールと自己注意モジュールを統合することで、特徴学習およびモデル一般化性能にどのような影響を与えるか?
  • RQ3提案された帰納的バイアスは、大規模アーキテクチャ(例:644Mパラメータ)にスケーリングした場合でも有効であるか?
  • RQ4標準的なビジョントランスフォーマーと比較して、提案アーキテクチャが優れたデータ効率性とより速い収束を達成できるか?
  • RQ5帰納的バイアスは、敵対的攻撃に対する耐性および低データ・高カテゴリタスク(例:ヒューマンポーズ推定)における性能向上に寄与するか?

主な発見

  • ViTAEv2は、プライベートデータを一切使用せずにImageNetで88.5%のTop-1精度、ImageNet-Realで91.2%の精度を達成し、新たな最先端性能を樹立した。
  • ViTAEv2-Sモデルは、AP-10Kヒューマンポーズ推定ベンチマークにおいてResNet-50よりも3%の絶対的AP向上を達成し、特に厳しいAP75指標においてSwins-Tを上回った。
  • モデルは優れたデータ効率性を示し、DeiT-TやT2T-ViT-7と比較して、少ない学習データでもより速く収束し、より高い性能を達成した。
  • ViTAEv2は$l_∞$敵対的攻撃において優れた耐性を示し、ViT、MLPMixer、ResNetを上回る性能を示した。
  • 帰納的バイアスはスケーリング時にも有効である:ViTAE-HはImageNet-22Kでも強力な性能を示し、帰納的バイアスが大規模ビジョントランスフォーマーを強化することを確認した。
  • 縮小セルと正規セルの並列的・スケルトン接続設計により、相補的な学習が可能となり、注意機構が長距離依存性に注目し、畳み込みが局所構造に注目するという関係が、注目距離解析によって裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。