Skip to main content
QUICK REVIEW

[論文レビュー] A survey on efficient vision transformers: algorithms, techniques, and performance benchmarking

Lorenzo Papa, Paolo Russo|arXiv (Cornell University)|Sep 5, 2023
CCD and CMOS Imaging Sensors参考文献 81被引用数 4
ひとこと要約

本調査では、ビジョントランスフォーマー(ViTs)の4つの主要な効率化戦略—コンactアーキテクチャ、プルーニング、知識蒸留、量子化—について包括的な分析を提案し、モデルの効率性を公平にベンチマークするための新規指標である効率誤差率(EER)を導入している。ハイブリッド戦略、例えばプルーニングと知識蒸留を統合したDynamicViTのような手法が、パフォーマンスと計算コストの最良なトレードオフを実現していることが明らかになった。

ABSTRACT

Vision Transformer (ViT) architectures are becoming increasingly popular and widely employed to tackle computer vision applications. Their main feature is the capacity to extract global information through the self-attention mechanism, outperforming earlier convolutional neural networks. However, ViT deployment and performance have grown steadily with their size, number of trainable parameters, and operations. Furthermore, self-attention's computational and memory cost quadratically increases with the image resolution. Generally speaking, it is challenging to employ these architectures in real-world applications due to many hardware and environmental restrictions, such as processing and computational capabilities. Therefore, this survey investigates the most efficient methodologies to ensure sub-optimal estimation performances. More in detail, four efficient categories will be analyzed: compact architecture, pruning, knowledge distillation, and quantization strategies. Moreover, a new metric called Efficient Error Rate has been introduced in order to normalize and compare models' features that affect hardware devices at inference time, such as the number of parameters, bits, FLOPs, and model size. Summarizing, this paper firstly mathematically defines the strategies used to make Vision Transformer efficient, describes and discusses state-of-the-art methodologies, and analyzes their performances over different application scenarios. Toward the end of this paper, we also discuss open challenges and promising research directions.

研究の動機と目的

  • ビジョントランスフォーマーにおける4つの主要な効率化戦略—コンパクトアーキテクチャ、プルーニング、知識蒸留、量子化—を体系的に分析・比較すること。
  • 画像解像度の増加に伴い自己注意計算が二次関数的に増加するため、計算コストの高いViTをリソース制約のあるデバイスに展開する課題に対処すること。
  • FLOPs、パラメータ数、モデルサイズなどのハードウェア制約を考慮し、モデルの効率性を正規化して比較可能な新しい評価指標、効率誤差率(EER)を導入すること。
  • 汎用コンピュータビジョンアプリケーションにおける、モデルの精度と推論効率の最適なバランスを特定すること。
  • 今後の研究のための一般化性、評価指標、マルチ戦略統合の分野における未解決の課題を強調すること。

提案手法

  • コンパクトアーキテクチャ(CA)、プルーニング(P)、知識蒸留(KD)、量子化(Q)の4つの主要な効率化技術を分類・形式化し、それらのコアメカニズムを数学的に定式化する。
  • 効率誤差率(EER)指標を導入し、FLOPs、パラメータ数、ビット数、モデルサイズを考慮しながら、非効率なベースラインとの誤差率比較によって、モデルの効率性を正規化して比較可能にする。
  • 各カテゴリにおける最先端の手法をレビューし、その強み・弱み、アーキテクチャ的革新を分析する。
  • 標準データセット(例:ImageNet)を用いて、トップ1精度、FLOPs、パラメータ数といった標準化された指標でモデルをベンチマークする。
  • 分類、セグメンテーション、深度推定などの多様なアプリケーションシナリオにおいて、モデルのパフォーマンスを評価する。
  • プルーニングと知識蒸留を組み合わせるなど、複数の技術を統合するマルチ戦略統合フレームワークを提案し、特にDynamicViTを例示することで、精度損失を最小限に抑えつつ効率性を最大化する。
Figure 1: Graphical overview of the vanilla self-attention and the multi-head self-attention blocks. The $\mathcal{O}(n^{2})$ in the softmax dot-product self-attention highlights the quadratic cost of each operation.
Figure 1: Graphical overview of the vanilla self-attention and the multi-head self-attention blocks. The $\mathcal{O}(n^{2})$ in the softmax dot-product self-attention highlights the quadratic cost of each operation.

実験結果

リサーチクエスチョン

  • RQ1コンパクトアーキテクチャ、プルーニング、知識蒸留、量子化という4つの効率化戦略の中で、モデルの精度と計算効率のトレードオフが最も優れているのはどれか?
  • RQ2異なるハードウェアフットプリントとパフォーマンス特性を持つモデルを公平に比較するための統一された指標はどのように構築できるか?
  • RQ3複数の効率化技術を統合するハイブリッド戦略は、単一手法に比べてどの程度優れているか?
  • RQ4現在の評価プロトコルには、レイテンシーやメモリ使用量といった実世界の展開制約を十分に捉えていないという限界は何か?
  • RQ5効率的なViTは敵対的条件下や分類以外のタスクにおいてどのように動作するのか?また、多様なビジョンタスクに一般化できるか?

主な発見

  • 効率誤差率(EER)指標は、FLOPs、パラメータ数、ビット数、モデルサイズといった異なるハードウェア制約を考慮して、ViTモデルの効率性を正規化し、従来の指標よりも包括的な効率性の視覚化を可能にした。
  • 単一の戦略がすべての指標で優れているわけではないが、プルーニングと知識蒸留を統合したハイブリッドアプローチ、例えばDynamicViTは、精度の低下を最小限に抑えつつ優れたパフォーマンスを達成している。
  • 知識蒸留と量子化は、特にアーキテクチャ的圧縮と組み合わせた場合、モデルサイズと推論FLOPsを著しく削減しつつ、精度の損失を最小限に抑えられる。
  • プルーニング技術、特に構造的プルーニングは、特にトレーニング後の適用時において、パラメータ数とFLOPsを顕著に削減しながらも高いトップ1精度を維持できる。
  • Swim Transformer や MobileViT といったコンパクトアーキテクチャ設計は、効率的な自己注意メカニズムと階層的特徴抽出により、低リソースデバイスでも優れたパフォーマンスを示している。
  • 本研究では、現在のベンチマークが主に画像分類に限定されており、今後の研究では、密度予測タスクや敵対的耐性の評価を拡張する必要があることが明らかになった。
Figure 2: Graphical representation of the vanilla KD learning strategy. Please refer to Section 2.3 for the used notation.
Figure 2: Graphical representation of the vanilla KD learning strategy. Please refer to Section 2.3 for the used notation.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。