Skip to main content
QUICK REVIEW

[論文レビュー] Searching for Efficient Multi-Stage Vision Transformers

Yi-Lun Liao, Sertaç Karaman|arXiv (Cornell University)|Sep 1, 2021
CCD and CMOS Imaging Sensors参考文献 66被引用数 12
ひとこと要約

この論文では、空間的縮小を組み込んだ残差構造を統合することで、段階的な特徴抽出を可能にし、各段階で系列長を短縮するとともに特徴次元を向上させる、効率的なマルチステージVision TransformerアーキテクチャであるViT-ResNASを提案する。さらに、複数のアーキテクチャを同時にサンプリングする新しい重み共有NAS手法を組み合わせ、ImageNet上でのSOTA水準の精度-MACsおよび精度スループットトレードオフを達成した。DeiT、PVT、PiTのベースラインを大きく上回り、FLOPsは著しく低く抑えられ、スループットは向上した。

ABSTRACT

Vision Transformer (ViT) demonstrates that Transformer for natural language processing can be applied to computer vision tasks and result in comparable performance to convolutional neural networks (CNN), which have been studied and adopted in computer vision for years. This naturally raises the question of how the performance of ViT can be advanced with design techniques of CNN. To this end, we propose to incorporate two techniques and present ViT-ResNAS, an efficient multi-stage ViT architecture designed with neural architecture search (NAS). First, we propose residual spatial reduction to decrease sequence lengths for deeper layers and utilize a multi-stage architecture. When reducing lengths, we add skip connections to improve performance and stabilize training deeper networks. Second, we propose weight-sharing NAS with multi-architectural sampling. We enlarge a network and utilize its sub-networks to define a search space. A super-network covering all sub-networks is then trained for fast evaluation of their performance. To efficiently train the super-network, we propose to sample and train multiple sub-networks with one forward-backward pass. After that, evolutionary search is performed to discover high-performance network architectures. Experiments on ImageNet demonstrate that ViT-ResNAS achieves better accuracy-MACs and accuracy-throughput trade-offs than the original DeiT and other strong baselines of ViT. Code is available at https://github.com/yilunliao/vit-search.

研究の動機と目的

  • 畳み込みニューラルネットワーク(CNNs)の設計原則、特に空間的縮小とマルチステージアーキテクチャをVision Transformer(ViT)に取り入れることで、その効率性と性能を向上させること。
  • 深層ViTモデルにおける高い計算コストと訓練不安定性の課題に、空間的縮小の過程で残差接続を導入することで対処すること。
  • マルチステージViTに特化したより効率的なニューラルアーキテクチャ探索(NAS)フレームワークを開発し、迅速かつ正確なアーキテクチャ探索を可能にすること。
  • DeiT、PVT、PiTなどの既存のViTモデルと比較して、ImageNetベンチマーク上でより優れた精度-計算トレードオフを達成すること。

提案手法

  • 残差空間的縮小を提案:各段階で空間的解像度を低下させ、チャネル数を増加させるマルチステージViT設計で、訓練の安定化と性能向上を図るスキップ接続を統合する。
  • 複数のサブネットワークを一度の順伝播・逆伝播でサンプリング・訓練可能な、スーパーネットベースのNASフレームワークを導入する。
  • ベースのViT-Resアーキテクチャを深さと幅の両方で拡張することで、探索可能な多様なサブネットワークを効率的に得るための探索空間を構築する。
  • 訓練済みスーパーネット上でエボリューションサーチを実行し、再訓練なしに高性能なアーキテクチャを発見する。
  • 探索空間内のすべてのサブネットワークに重み共有を適用し、個々の訓練なしにスーパーネットの重みを用いて性能を推定可能にする。
  • アーキテクチャのバッチ非依存性を活用することで、NASパイプラインにおける訓練効率と探索品質を向上させる。

実験結果

リサーチクエスチョン

  • RQ1畳み込みニューラルネットワークに類似したマルチステージアーキテクチャを実現する残差空間的縮小は、Vision Transformerの精度と効率性を向上させることができるか?
  • RQ2計算コストを低減しつつ、マルチステージVision Transformerに対してより効率的かつ効果的なNASをどのように実現できるか?
  • RQ3複数アーキテクチャを同時にサンプリングする重み共有NASは、標準的なNAS手法に比べて、高性能なViTアーキテクチャの発見において優れていると期待できるか?
  • RQ4提案手法は、最先端のViTモデルと比較して、精度-MACsおよび精度スループットトレードオフをどの程度改善するか?
  • RQ5空間的縮小の過程で残差接続を統合することで、より深いViTモデルの訓練が安定化し、性能が向上するか?

主な発見

  • ViT-ResNAS-Tinyは、DeiT-Tinyと比較してトップ-1精度が8.6%高く、MACsは0.5Gのみ増加し、スループットはわずかに低かった。
  • ViT-ResNAS-Smallは、DeiT-Baseと同等の精度を達成したが、MACsは6.3倍少なく、1つのTitan RTX GPU上ではスループットが3.7倍向上した。
  • PiT-Sと比較して、ViT-ResNAS-Tinyは同等の精度を達成したが、MACsは1.6倍少なく、スループットは1.6倍向上した。
  • ViT-ResNAS-Mediumは、PiT-Bと比較して0.4%高い精度を達成したが、MACsは2.8倍少なく、スループットは2.4倍向上した。
  • 低MAC領域(約2.0G)では、ViT-ResNAS-TinyはViL-Tinyを精度-MACsトレードオフで上回った。高MAC領域(約5.0G)では、ViL-Smallの性能に並んだ。
  • 提案された重み共有NASと多様アーキテクチャサンプリングにより、スーパーネットの訓練が高速化され、標準的なNAS手法よりも優れた性能を発揮するアーキテクチャが得られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。