[論文レビュー] Evo-ViT: Slow-Fast Token Evolution for Dynamic Vision Transformer
Evo-ViT は、動的ビジョントランスフォーマーにおける自己動機付け型のゆっくり・速いトークン進化手法を提案する。これは、ネイティブなグローバルクラスアテンションを用いて、構造のないインスタンスごとのトークン選択を可能にするとともに、二重計算パスによって空間的構造を維持する。ImageNet-1K において、DeiT-S の処理速度を 60% 以上向上させ、トップ1精度をたった 0.4% 低下させる。既存のプルーニング手法に比べ、効率性と精度保持の両面で優れている。
Vision transformers (ViTs) have recently received explosive popularity, but the huge computational cost is still a severe issue. Since the computation complexity of ViT is quadratic with respect to the input sequence length, a mainstream paradigm for computation reduction is to reduce the number of tokens. Existing designs include structured spatial compression that uses a progressive shrinking pyramid to reduce the computations of large feature maps, and unstructured token pruning that dynamically drops redundant tokens. However, the limitation of existing token pruning lies in two folds: 1) the incomplete spatial structure caused by pruning is not compatible with structured spatial compression that is commonly used in modern deep-narrow transformers; 2) it usually requires a time-consuming pre-training procedure. To tackle the limitations and expand the applicable scenario of token pruning, we present Evo-ViT, a self-motivated slow-fast token evolution approach for vision transformers. Specifically, we conduct unstructured instance-wise token selection by taking advantage of the simple and effective global class attention that is native to vision transformers. Then, we propose to update the selected informative tokens and uninformative tokens with different computation paths, namely, slow-fast updating. Since slow-fast updating mechanism maintains the spatial structure and information flow, Evo-ViT can accelerate vanilla transformers of both flat and deep-narrow structures from the very beginning of the training process. Experimental results demonstrate that our method significantly reduces the computational cost of vision transformers while maintaining comparable performance on image classification.
研究の動機と目的
- 序列長に伴い二次関数的に増加する計算量に起因するビジョントランスフォーマーの非効率性を是正すること。
- 空間的構造を破壊するか、事前学習を要する既存のトークンプルーニング手法の制限を克服すること。
- フラットかつディープ・ニードルなトランスフォーマー構造の両方において、スクラッチから効率的で動的なトークン選択を可能にすること。
- 計算削減の過程でも情報の流れと空間的一致性を維持すること。
- 構造的圧縮手法(例:ディープ・ニードルなViTにおけるもの)と互換性を持つプラグイン型ソリューションを開発すること。
提案手法
- 最終層のグローバルクラスアテンションを用いて、入力インスタンスごとに情報量の多いトークンとプレースホルダートークンを動的に同定する。
- ゆっくり・速い更新メカニズムを導入:情報量の多いトークンはフル計算パスを経由し、プレースホルダートークンは軽量パスを経由する。
- トークンを削除せずに、二重パスによって完全な空間的構造と情報の流れを維持する。
- 段階を経て安定化するトークン選択を実現するため、レイヤーからステージへの訓練戦略を採用する。
- 全レイヤーにわたって一貫したトークン保持率を適用し、最適なパフォーマンスは均一な保持率(例:全レイヤーで50%)で達成される。
- 深いレイヤーにおけるクラストークンのアテンションスコアを、データ依存の動的基準としてトークン選択に用いる。
実験結果
リサーチクエスチョン
- RQ1空間的構造を損なうことなく、スクラッチから構造のないトークン選択をビジョントランスフォーマーに効果的に適用できるか?
- RQ2事前学習や固定プルーニングマスクを必要とせずに、動的でインスタンスごとのトークン選択を実現できるか?
- RQ3二重パス(ゆっくり・速い)更新メカニズムは、フラットおよびディープ・ニードルなViTアーキテクチャの両方において、計算削減を伴いながらパフォーマンスを維持できるか?
- RQ4効率性と精度を最大化するための、レイヤー間での最適なトークン保持率戦略は何か?
- RQ5プレースホルダートークンを維持しつつ、軽量パスで更新することで、プルーニングと比較してパフォーマンスが維持または向上するか?
主な発見
- Evo-ViT は、ImageNet-1K において DeiT-S の処理速度を 60% 以上向上させ、トップ1精度をたった 0.4% 低下させる。既存のプルーニング手法に比べ優れた性能を発揮する。
- 本手法は、DeiT や LeViT を含むさまざまな ViT アーキテクチャにおいて一貫したパフォーマンスを発揮し、広範な適用可能性を示している。
- 全レイヤーにわたって一貫したトークン保持率を適用すると最良のパフォーマンスが得られ、これはフルネットワークを通過する情報量の多いトークンの数を最大化するからである。
- トレーニング中にトークン選択が進化する:初期は不安定であったが、時間経過とともに安定化し、魚の尾やコウノトリの羽根の一部といった情報量の多いトークンが、深いレイヤーで段階的に選択されるようになる。
- 可視化結果から、本手法は背景ではなく物体に注目していることが確認され、構造を保存する設計のおかげで、深いレイヤーで見逃されたトークンが回復されている。
- 深いレイヤー(例:レイヤー10)からのグローバルクラスアテンションは、最終レイヤーのみまたはカラム平均アテンション戦略に比べ、より効果的で安定した選択信号を提供する。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。