Skip to main content
QUICK REVIEW

[論文レビュー] Multi-Exit Vision Transformer for Dynamic Inference

Arian Bakhtiarnia, Qi Zhang|arXiv (Cornell University)|Jun 29, 2021
Advanced Neural Network Applications被引用数 8
ひとこと要約

本稿では、ビジョントランスフォーマーにおける動的推論を可能にするために、7つの新しいイ早出口ブランチアーキテクチャを提案する。これにより、簡単なサンプルに対しては高速な予測が可能となる一方で、精度を維持する。画像分類および回帰タスクにおける広範な実験の結果、ViT-EEおよびMLP-EEブランチがエンドツーエンド学習下で速度と精度の最良のトレードオフを達成し、ViT-EEはCIFAR-100で最終的エグジットで97.33%の精度を達成するとともに、フル推論と比較して最大67%のFLOPS削減を実現した。

ABSTRACT

Deep neural networks can be converted to multi-exit architectures by inserting early exit branches after some of their intermediate layers. This allows their inference process to become dynamic, which is useful for time critical IoT applications with stringent latency requirements, but with time-variant communication and computation resources. In particular, in edge computing systems and IoT networks where the exact computation time budget is variable and not known beforehand. Vision Transformer is a recently proposed architecture which has since found many applications across various domains of computer vision. In this work, we propose seven different architectures for early exit branches that can be used for dynamic inference in Vision Transformer backbones. Through extensive experiments involving both classification and regression problems, we show that each one of our proposed architectures could prove useful in the trade-off between accuracy and speed.

研究の動機と目的

  • 遅延制約のあるエッジおよびIoTアプリケーションにおけるビジョントランスフォーマーの動的推論を可能にすること。
  • 推論時間の短縮を実現しながら性能を維持する複数のイ早出口ブランチアーキテクチャの設計と評価を行うこと。
  • アテンション機構、正規化、バックボーン層との類似性といったアーキテクチャ的選択がイ早出口性能に与える影響を調査すること。
  • マルチエグジットViTにおける3つの学習戦略(エンドツーエンド、レイヤー単位、分類器単位)を比較し、最適な設定を同定すること。

提案手法

  • MLP-EE、CNN-Ignore-EE、CNN-Add-EE、CNN-Project-EE、ViT-EE、MLP-Mixer-EE、ResMLP-EEの7つの異なるイ早出口ブランチアーキテクチャを提案。それぞれが異なるアーキテクチャ的特徴を有する。
  • これらのブランチをビジョントランスフォーマーのバックボーンの中間層に統合し、フルフォワードパスの完了前に早期予測を可能にする。
  • エンドツーエンド(共同最適化)、レイヤー単位(段階的ファインチューニング)、分類器単位(ブランチ学習中にバックボーンを固定)の3つの学習戦略を採用。
  • FLOPSと精度の指標を用いて、異なるエグジット位置とデータセットにおける速度と性能のトレードオフを評価。
  • 画像分類(CIFAR-10、CIFAR-100、Fashion-MNIST)および回帰(DISCO集団数カウント)タスクでモデルを評価。
  • 受容 field、アテンションタイプ、正規化、バックボーンとのアーキテクチャ的類似性といった要因がエグジット性能に与える影響を分析。

実験結果

リサーチクエスチョン

  • RQ1ビジョントランスフォーマーにおける動的推論の文脈で、どのイ早出口ブランチアーキテクチャが最も優れた精度-速度トレードオフを達成するか?
  • RQ2エンドツーエンド、レイヤー単位、分類器単位の異なる学習戦略が、マルチエグジットViTモデルの性能にどのように影響するか?
  • RQ3イ早出口ブランチとバックボーン層とのアーキテクチャ的類似性が、イ早出口性能にどの程度寄与するか?
  • RQ4アテンション機構、正規化、受容 field のサイズといったアーキテクチャ的要素が、イ早出口精度にどのように影響するか?
  • RQ5マルチエグジットViTアーキテクチャは、早期レイヤーで高い性能を達成しつつ、計算コストを大幅に削減できるか?

主な発見

  • ViT-EEブランチは、全アーキテクチャの中で最高の精度を達成し、CIFAR-100で最終エグジットで97.33%の精度を記録。バックボーンパラメータの劣化は最小限に抑えられた。
  • MLP-EEおよびViT-EEブランチは、最も望ましい精度-速度トレードオフを示し、フル推論と比較して最大67%のFLOPS削減を実現しながらも高い精度を維持した。
  • エンドツーエンド学習戦略がレイヤー単位および分類器単位の戦略を上回り、特にバックボーン性能の維持と効果的なマルチエグジット学習の実現に優れていた。
  • バックボーンとはアーキテクチャ的差異を有するCNNベースのブランチ(例:CNN-Ignore-EE)は、類似性の高いもの(例:ViT-EE)よりも性能が低かった。これは、アーキテクチャ的一致性の重要性を示している。
  • 後続レイヤー(例:Early@9)に配置されたブランチは、アーキテクチャと学習戦略が適切に整合されている場合にのみ、より高い精度を達成した。
  • レイヤー単位学習戦略は、初期のファインチューニング後に事前学習済み重みが失われたため、後続段階で高い精度を達成できず、実用性に制限があった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。