[論文レビュー] CF-ViT: A General Coarse-to-Fine Method for Vision Transformer
CF-ViT は、ビジョントランスフォーマーにおける計算コストを削減する一般化された粗くから細かくまでの推論フレームワークを提案する。まず粗いグレインのパッチ(7×7)で画像を分類し、不確実な予測のみを細かいグレインのパッチ分割(14×14)で精錬する。LV-ViTと比較して53%のFLOPs削減と2.01倍のスループット向上を達成し、性能の低下なしに、クラスアテンションを用いて適応的に精錬を行う情報的な領域を同定する。
Vision Transformers (ViT) have made many breakthroughs in computer vision tasks. However, considerable redundancy arises in the spatial dimension of an input image, leading to massive computational costs. Therefore, We propose a coarse-to-fine vision transformer (CF-ViT) to relieve computational burden while retaining performance in this paper. Our proposed CF-ViT is motivated by two important observations in modern ViT models: (1) The coarse-grained patch splitting can locate informative regions of an input image. (2) Most images can be well recognized by a ViT model in a small-length token sequence. Therefore, our CF-ViT implements network inference in a two-stage manner. At coarse inference stage, an input image is split into a small-length patch sequence for a computationally economical classification. If not well recognized, the informative patches are identified and further re-split in a fine-grained granularity. Extensive experiments demonstrate the efficacy of our CF-ViT. For example, without any compromise on performance, CF-ViT reduces 53% FLOPs of LV-ViT, and also achieves 2.01x throughput.
研究の動機と目的
- 均一な高解像度パッチ処理に起因するビジョントランスフォーマー内の計算の冗長性を低減すること。
- 計算を節約できる、粗いグレインのパッチで正確に分類可能な画像を特定すること。
- 「難しい」画像の情報的な領域にのみ細かいグレインのパッチを用いて精錬し、精度を維持すること。
- さまざまなViTアーキテクチャに適用可能な一般化された、入力に適応する推論戦略を開発すること。
提案手法
- モデルは二段階の推論パイプラインを用いる:粗い段階では7×7のパッチ、不確実なサンプルに対しては細かい段階で14×14のパッチを使用する。
- 最後のエンコーダからのクラスアテンションを用いて、さらなる分割が必要な情報的なパッチを同定する。
- 信頼度のしきい値ηを用いて、細かい段階に進むかどうかを決定し、計算を適応的に制御する。
- 知識蒸留損失は交差エントロピーとKLダイバージェンスを組み合わせ、粗い予測と細かい予測を一致させる。
- 情報的な領域にのみ動的に分割を行い、画像全体の再処理を回避する。
- 損失関数を用いてエンドツーエンドに訓練し、粗い予測が細かい出力と一致するよう促進する。
実験結果
リサーチクエスチョン
- RQ1粗いグレインのパッチ分割(7×7)は、効率的なViT推論のための情報的な領域を効果的に同定できるか?
- RQ2少数の粗いトークンで、大多数の画像に対して高い精度を達成できるか? これにより、全体のFLOPsが削減されるか?
- RQ3情報的なパッチにのみ適応的に精錬することで、均一な細かいグレイン処理に比べ、効率性と精度の両面で優れているか?
- RQ4信頼度しきい値ηの選択が、精度と計算コストのトレードオフにどのように影響するか?
主な発見
- CF-ViT は LV-ViT と比較して 53% の FLOPs 削減と 2.01 倍のスループット向上を達成し、性能の低下なしに実現した。
- 7×7 パッチのみを用いることで、DeiT-S はトップ1精度 73.2% を達成し、多くの画像が「簡単」であり、粗く分類可能であることを示した。
- モデルは粗い段階で 76.8% の画像を正しく分類し、残りの 23.2% が細かいグレインの精錬を必要としている。
- アブレーションスタディの結果、情報的な領域の同定が極めて重要であることが判明した。同定がなければ、画像全体の再分割によりFLOPsが著しく増加する。
- 損失関数およびアテンション重み付け部において、α = 0.5 と β = 0.99 を設定した場合が、精度と効率のバランスにおいて最良の結果を示した。
- CE+KL 損失関数は CE+CE よりも優れており、細かい段階の精度低下を 0.5% 減少させつつ、粗い段階の性能もわずかに向上させた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。