Skip to main content
QUICK REVIEW

[論文レビュー] CP-ViT: Cascade Vision Transformer Pruning via Progressive Sparsity Prediction

Zhuoran Song, Yihong Xu|arXiv (Cornell University)|Mar 9, 2022
CCD and CMOS Imaging Sensors被引用数 20
ひとこと要約

CP-ViT は、視覚トランスフォーマーに対してカスケード剪定を導入し、情報量の少ないパッチとヘッドを逐次予測・剪定することで、累積スコアと層別(レイヤー対応)剪定を用い、ほぼ精度を損なうことなく FLOPs を削減する。ファインチューニングの有無を問わず。

ABSTRACT

Vision transformer (ViT) has achieved competitive accuracy on a variety of computer vision applications, but its computational cost impedes the deployment on resource-limited mobile devices. We explore the sparsity in ViT and observe that informative patches and heads are sufficient for accurate image recognition. In this paper, we propose a cascade pruning framework named CP-ViT by predicting sparsity in ViT models progressively and dynamically to reduce computational redundancy while minimizing the accuracy loss. Specifically, we define the cumulative score to reserve the informative patches and heads across the ViT model for better accuracy. We also propose the dynamic pruning ratio adjustment technique based on layer-aware attention range. CP-ViT has great general applicability for practical deployment, which can be applied to a wide range of ViT models and can achieve superior accuracy with or without fine-tuning. Extensive experiments on ImageNet, CIFAR-10, and CIFAR-100 with various pre-trained models have demonstrated the effectiveness and efficiency of CP-ViT. By progressively pruning 50\% patches, our CP-ViT method reduces over 40\% FLOPs while maintaining accuracy loss within 1\%.

研究の動機と目的

  • ViT でのスパース性を探り、精度を左右する情報量の多いパッチとヘッド(PH レジオン)を特定する。
  • 最小限の精度低下で、情報量の少ないPH-レジオンを動的に剪定するカスケード剪定フレームワークを開発する。
  • 層を跨いで情報量の多いPH-レジオンを保持する累積スコア機構を導入する。
  • 注意分布範囲(アテンションレンジ)に基づく層対応の剪定比の調整手法を提案し、効率と精度のバランスを取る。
  • ViT モデル全般への広範な適用性を示し、微調整有無での性能を示す。

提案手法

  • アテンション確率に由来するパッチ/ヘッド情報量から、ViT における情報量の多いPH-レジオンを定義する。
  • 層を跨ぐ累積スコアを算出するための、進行的なスパース予測フレームワークを用いる。
  • MHSA と FFN で情報量の少ないPH-レジオンをマスキングしてカスケード剪定を適用し、後続層での計算をスキップ可能にする。
  • 層ごとの剪定比を、アテンション範囲を活用して層ごとに適応させる Layer-Aware Pruning Ratio 手法で計算する。
  • 情報量を効率的に近似するため、最大アテンション確率値に基づいて剪定を実施する。
  • 剪定下での精度向上のため、事前学習済みモデルを任意でファインチューニングする。

実験結果

リサーチクエスチョン

  • RQ1ViTモデルは、情報量の多いパッチとヘッドを通じて著しく精度に影響を与えるスパース性を示すことができるか。
  • RQ2カスケード剪定法は、層間で情報量の少ないPH-レジオンを捨てつつ精度を保持できるか。
  • RQ3層間の注意範囲の違いを考慮して、層ごとに剪定比を動的に調整するにはどうすればよいか。
  • RQ4多様なViTアーキテクチャにおいて、ファインチューニングの有無にかかわらず、FLOPs を大幅に削減して高精度を維持できるか。

主な発見

  • CP-ViT は、パッチの約 50% を剪定し、FLOPs を約 40% 以上削減しつつ、精度損失を 1% 未満に抑えることができる(ファインチューニングなし)。
  • アテンション範囲を介して層ごとに調整された剪定比は、頑健性を高め、より大きな剪定レベルでの精度損失を低減する。
  • 累積スコアを用いた進行的なスパース予測は、層を跨いで情報量の多いPH-レジオンを保持し、ランダム剪定や素朴な層非依存剪定を上回る。
  • CP-ViT は、他の ViT 剪定法と比較して、ファインチューニングの有無にかかわらず、精度と FLOPs の好適なトレードオフを提供する。
  • CP-ViT のファインチューニングは、いくつかの ViT モデルで達成可能な FLOPs 削減を大幅に増加させつつ、精度を維持またはわずかに向上させる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。