Skip to main content
QUICK REVIEW

[論文レビュー] AdaViT: Adaptive Vision Transformers for Efficient Image Recognition

Lingchen Meng, Hengduo Li|arXiv (Cornell University)|Nov 30, 2021
Advanced Neural Network Applications参考文献 49被引用数 15
ひとこと要約

AdaViTは、入力画像ごとにパッチ、自己注意ヘッド、トランスフォーマーブロックを動的に選択することで、視覚トランスフォーマーの推論効率を向上させる適応的計算フレームワークを導入する。Gumbel-Softmaxを用いてバックボーンと同時に軽量な意思決定ネットワークを共同で学習することで、SOTAモデルと比較して2倍以上の高速化を達成しながら、ImageNet上での精度低下はたった0.8%にとどめる。

ABSTRACT

Built on top of self-attention mechanisms, vision transformers have demonstrated remarkable performance on a variety of vision tasks recently. While achieving excellent performance, they still require relatively intensive computational cost that scales up drastically as the numbers of patches, self-attention heads and transformer blocks increase. In this paper, we argue that due to the large variations among images, their need for modeling long-range dependencies between patches differ. To this end, we introduce AdaViT, an adaptive computation framework that learns to derive usage policies on which patches, self-attention heads and transformer blocks to use throughout the backbone on a per-input basis, aiming to improve inference efficiency of vision transformers with a minimal drop of accuracy for image recognition. Optimized jointly with a transformer backbone in an end-to-end manner, a light-weight decision network is attached to the backbone to produce decisions on-the-fly. Extensive experiments on ImageNet demonstrate that our method obtains more than 2x improvement on efficiency compared to state-of-the-art vision transformers with only 0.8% drop of accuracy, achieving good efficiency/accuracy trade-offs conditioned on different computational budgets. We further conduct quantitative and qualitative analysis on learned usage polices and provide more insights on the redundancy in vision transformers.

研究の動機と目的

  • 入力パッチ数とモデルの深さに比例して計算コストが増加する視覚トランスフォーマーの高コスト問題に対処する。
  • 複雑な画像は単純な画像よりも多くの計算を要することに着目し、視覚トランスフォーマーにおける冗長性を同定・活用する。
  • パッチ、注目ヘッド、トランスフォーマーブロックのインスタンス固有の使用ポリシーを学習するエンドツーエンドで訓練可能なフレームワークを開発する。
  • 入力の複雑さに基づいて計算リソースを動的に割り当てることで、精度を損なわず効率的な推論を実現する。
  • さまざまな視覚トランスフォーマーベースに適用可能で、アーキテクチャへの変更を最小限に抑えた柔軟でモデルに依存しないソリューションを提供する。

提案手法

  • 各トランスフォーマーブロックに軽量な意思決定ネットワークを接続し、パッチ、注目ヘッド、ブロックの使用意思決定(バイナリ)を予測する。
  • 学習段階で離散的決定の微分可能なサンプリングを可能にするためにGumbel-Softmaxを用いる。
  • 交差エントロピー分類損失と使用コスト損失を組み合わせた複合損失関数を用い、意思決定ネットワークと視覚トランスフォーマーベースを同時に最適化する。
  • ハイパーパrameter γ ∈ (0,1] を用いて、訓練中に許容される全モデルコストの割合(パcent)を制御する。
  • 入力ごとの適応性を実現:簡単な画像は少ないパッチ/ヘッド/ブロックを使用、複雑な画像はより多くのリソースを割り当て、学習されたポリシーに従う。
  • モデルに依存しない設計を採用し、DeiT や T2T-ViT などのさまざまな視覚トランスフォーマーアーキテクチャに容易に統合可能である。

実験結果

リサーチクエスチョン

  • RQ1視覚トランスフォーマーは、入力の複雑さに応じて、入力画像ごとに計算負荷を動的に調整できるか?
  • RQ2精度の著しい低下を伴わずに、どれほど冗長なパッチ、注目ヘッド、トランスフォーマーブロックを削除できるか?
  • RQ3異なる画像クラスや複雑さレベルにおいて、学習された適応的計算ポリシーはどのように変化するか?
  • RQ4エンドツーエンドで訓練可能で、軽量な意思決定ネットワークは、微分可能な方法で計算リソースを効果的に割り当てられるように学習できるか?
  • RQ5適応的計算を視覚トランスフォーマーに適用する際、推論効率と精度のトレードオフはどのように変化するか?

主な発見

  • AdaViTは、ImageNet上でのSOTA視覚トランスフォーマーと比較して、推論効率を2倍以上に向上させ、精度低下はわずか0.8%にとどまる。
  • この手法は、複雑でごちゃついた画像(例:'barber shop'、'toyshop')に対してより多くの計算を割り当て、単純でオブジェクト中心の画像(例:'parachute'、'kite')に対しては少ない計算を割り当てるように学習している。
  • パッチ選択では、深層のレイヤーにかけて計算量が段階的に減少しており、バックボーンの後段でより高い冗長性が生じていることが示唆される。
  • 意思決定ネットワークは、最終予測に重要な後段のトランスフォーマーブロックでより多くの計算を保持するように学習している。
  • 定性的な分析から、モデルが後段のレイヤーで判別に寄与する画像領域に注目しており、ネットワークが深くなるに従いアクティブなパッチ数が減少していることが確認された。
  • AdaViTはバックボーンに依存せず汎用的である:DeiT-small および T2T-ViT に適用した場合、標準的およびランダムなベースラインと比較して、より優れた効率/精度のトレードオフを達成している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。