Skip to main content
QUICK REVIEW

[論文レビュー] Patch Slimming for Efficient Vision Transformers

Yehui Tang, Kai Han|arXiv (Cornell University)|Jun 5, 2021
Advanced Neural Network Applications参考文献 31被引用数 12
ひとこと要約

この論文では、最終分類特徴量への影響に基づいて冗長なパッチを削除するトップダウンのプルーニング手法であるPatch Slimmingを提案する。各パッチの分類トークンへの寄与度を推定し、最も影響力のあるパッチのみを保持することで、ViT-TinyではFLOPsを45%以上削減しつつImageNet上で精度を0.2%しか低下させない。

ABSTRACT

This paper studies the efficiency problem for visual transformers by excavating redundant calculation in given networks. The recent transformer architecture has demonstrated its effectiveness for achieving excellent performance on a series of computer vision tasks. However, similar to that of convolutional neural networks, the huge computational cost of vision transformers is still a severe issue. Considering that the attention mechanism aggregates different patches layer-by-layer, we present a novel patch slimming approach that discards useless patches in a top-down paradigm. We first identify the effective patches in the last layer and then use them to guide the patch selection process of previous layers. For each layer, the impact of a patch on the final output feature is approximated and patches with less impact will be removed. Experimental results on benchmark datasets demonstrate that the proposed method can significantly reduce the computational costs of vision transformers without affecting their performances. For example, over 45% FLOPs of the ViT-Ti model can be reduced with only 0.2% top-1 accuracy drop on the ImageNet dataset.

研究の動機と目的

  • リソース制約のあるデバイスへの展開を制限するVision Transformersの高い計算コストに対処する。
  • 畳み込みニューラルネットワーク(CNNs)におけるチャネルプルーニングとは異なり、層全体にわたる冗長なパッチを特定・削除する。
  • モデル性能を維持しながら推論を高速化する構造的なプルーニング戦略を開発する。
  • 原則的で誤差制御可能なパッチ削除プロセスにより、Vision Transformersの効率的展開を可能にする。
  • 深層層には浅層層よりも顕著にパッチレベルの冗長性が存在することを示す。

提案手法

  • 最終層から始まり、ネットワークを後退的に処理するトップダウンのプルーニングフレームワークを提案する。
  • 誤差逆伝播を用いて、各パッチが最終出力特徴量(クラストークン)に与える影響を測定することで、パッチの重要度を推定する。
  • FLOPs削減と精度損失のトレードオフを制御するため、グローバルな許容誤差閾値εを用いる。
  • 深い層における空間的同等のパッチが保持されていれば、そのパッチを保持することで情報の流れを維持する。
  • 最終予測への寄与度をランク付けするため、微分可能で勾配に基づくスコアをパッチに適用する。
  • 完全なファインチューニングを伴わずに、再構成誤差の近似を用いて各パッチの重要性を推定する。

実験結果

リサーチクエスチョン

  • RQ1Vision Transformersにおけるパッチレベルの冗長性は、顕著な性能低下を伴わずに効果的に特定・削除可能か?
  • RQ2Vision Transformersの異なる層において、パッチの冗長性はどのように変化するか?
  • RQ3均一またはランダムプルーニングと比較して、トップダウンのプルーニング戦略は、モデル性能を維持しながらFLOPsをより効果的に削減できるか?
  • RQ4パッチプルーニングにおいて、FLOPs削減と精度損失の最適なトレードオフは何か?
  • RQ5提案された影響推定法は、アテンションベースやランダムプルーニングと比較して、モデルの有用性をどれほど効果的に維持できるか?

主な発見

  • 提案されたPatch Slimming手法は、ViT-TinyモデルにおいてFLOPsを45.2%削減しつつ、ImageNet上でのトップ1精度を0.2%しか低下させない。
  • DeiT-SではFLOPsを45.8%削減し、精度を0.2%低下させるが、均一プルーニング(トップ1精度77.2%、-2.6%低下)を上回る性能を示す。
  • 深層層は浅層層よりも顕著に高いパッチ冗長性を示しており、トップダウンのプルーニング戦略の妥当性を裏付ける。
  • 同じプルーニング率において、提案手法の影響推定法は、ランダムまたはアテンションベースのプルーニングベースラインよりも精度損失が小さい。
  • プルーニング後のモデルは、浅層で多くのパッチが保持され、深層で多くのパッチが削除されるピラミッド型のアーキテクチャを形成する。
  • 高いプルーニング率においても高い性能を維持でき、FLOPs削減率が45%未満の範囲では、精度低下が0.4%未満に抑えられる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。