[論文レビュー] SaiT: Sparse Vision Transformers through Adaptive Token Pruning
SaiTは、入力画像の複雑さに応じてパッチトークンのスパarsityを動的に調整する統合的で適応可能なトークン pruning フレームワークを提案する。再訓練を必要とせず、実行時における精度とスループットのトレードオフを可能にする。密度/スパarsityの交互訓練、知識蒸留、パラメータフリーの適応的 pruning を組み合わせることで、DeiT および LVViT モデル全体で FLOPs を 39–43% 減少させ、スループットを 67–91% 向上させつつ、0.5% 未満の精度低下を実現する。
While vision transformers have achieved impressive results, effectively and efficiently accelerating these models can further boost performances. In this work, we propose a dense/sparse training framework to obtain a unified model, enabling weight sharing across various token densities. Thus one model offers a range of accuracy and throughput tradeoffs for different applications. Besides, we introduce adaptive token pruning to optimize the patch token sparsity based on the input image. In addition, we investigate knowledge distillation to enhance token selection capability in early transformer modules. Sparse adaptive image Transformer (SaiT) offers varying levels of model acceleration by merely changing the token sparsity on the fly. Specifically, SaiT reduces the computation complexity (FLOPs) by 39% - 43% and increases the throughput by 67% - 91% with less than 0.5% accuracy loss for various vision transformer models. Meanwhile, the same model also provides the zero accuracy drop option by skipping the sparsification step. SaiT achieves better accuracy and computation tradeoffs than state-of-the-art transformer and convolutional models.
研究の動機と目的
- エッジおよびリアルタイム応用における固定複雑度のビジョントランスフォーマーの非効率性に対処すること。
- 再訓練を必要とせず、複数の精度およびスループット設定をサポートする単一の統合モデルを可能にすること。
- 入力画像の複雑さに応じてトークンスパarsityを動的に調整し、計算を最適化すること。
- 知識蒸留と統合された密度/スパarsity訓練を通じて、スパース推論下でも高い精度を維持すること。
- 精度の低下を最小限に抑えつつ、計算コスト(FLOPs)を削減し、推論速度を向上させること。
提案手法
- 異なるトークンスパarsityレベルをサポートする単一の統合ビジョントランスフォーマーモデルを学習するための密度/スパarsityの交互訓練フレームワークを提案する。
- 累積的注目スコア確率質量に基づいてトークンを選択する適応的トークン pruning を導入し、入力画像ごとにスパarsityを動的に調整する。
- 初期トランスフォーマーレイヤーにおけるトークンの重要度推定を改善するため、DINO教師からの知識蒸留を採用する。
- 固定されたトークン数を避けるために、確率閾値までに最も重要なトークンを累積する質量ベースのスパース化戦略を採用する。
- 低重要度のトークンに対する注目計算をスキップすることで、追加計算を最小限に抑えるパラメータフリーの pruning を適用する。
- さまざまなトークン密度(0.2–0.9)の下で性能をバランスさせるために、最適な質量閾値を 0.7 に設定する。
実験結果
リサーチクエスチョン
- RQ1再訓練を必要とせず、単一のビジョントランスフォーマーモデルが複数の精度とスループットのトレードオフをサポートできるか?
- RQ2入力画像の複雑さに応じてトークンスパarsityをどのように適応的に調整すれば、計算を最小限に抑えられるか?
- RQ3スパース推論下での精度を維持するための最適なトレーニング戦略と蒸留の組み合わせは何か?
- RQ4適応的 pruning は、固定比または値ベースの pruning と比較して、精度と効率の面でどのように優れているか?
- RQ5DINO教師からの知識蒸留は、スパース推論における初期レイヤーでのトークン重要度学習をどのように改善できるか?
主な発見
- SaiTは、DeiT および LVViT モデル全体で FLOPs を 39–43% 減少させ、スループットを 67–91% 向上させつつ、0.5% 未満の精度低下を実現する。
- スパース化をスキップした場合、ベースライン精度(79.8%)を維持でき、精度損失なしの動作が可能である。
- DINO を蒸留教師として使用することで、DeiT-S よりも密度推論時で 1.6%、スパース推論時で 2.3% のトップ-1精度向上が達成された。
- 0.5 未満のトークン密度における質量ベースの適応的 pruning 戦略は、値ベースの pruning よりも優れた性能を示した。
- 質量閾値 0.7 は、広範なトークン密度範囲(0.2–0.9)で最適なパフォーマンスを発揮した。
- 統合モデルは、ベースラインモデルと比較して 35–71% の高いスループットと 43% の低い FLOPs を達成し、効率-精度トレードオフにおいて、最先端の CNN やトランスフォーマーモデルを上回った。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。