[論文レビュー] Beyond Text-Visual Attention: Exploiting Visual Cues for Effective Token Pruning in VLMs
本稿では、視覚的トークンのプルーニングに[CLS]トークンの注目度を活用することで、大規模言語モデル(LLM)における不正確なテキスト-視覚クロス注目度に依存せずに、VLMの推論効率を向上させる訓練フリーな視覚的トークンプルーニング手法FasterVLMを提案する。重要な視覚的トークンを早期にプルーニングすることで、FasterVLMは95%のトークン削減を達成しながら、LLaVA-1.5-7Bの90%の性能を維持し、高い削減比において既存手法を著しく上回る性能を示す。
Large vision-language models (LVLMs) generally contain significantly more visual tokens than their textual counterparts, resulting in a considerable computational burden. Recent efforts have been made to tackle this issue by pruning visual tokens early within the language model. Most existing works use attention scores between text and visual tokens to assess the importance of visual tokens. However, in this study, we first analyze the text-visual attention in the language model and find that this score is not an ideal indicator for token pruning. Based on the analysis, We propose VisPruner, a plug-and-play method that utilizes visual cues for more effective token pruning in LVLMs. Specifically, we first use visual attention to select a limited number of significant tokens. Then, we remove duplicate tokens from the remaining ones based on their similarity. By retaining diverse tokens alongside the initially selected important tokens, we maximally preserve the visual information of the input image. Experimental results demonstrate that our VisPruner sustains strong performance across various VLM architectures and reduction ratios, significantly outperforming existing methods based on text-visual attention. Notably, without any training, VisPruner can reduce the FLOPs of LLaVA-1.5-7B by 91% and inference latency by 75%, while maintaining comparable performance. Our code is available at https://github.com/Theia-4869/VisPruner.
研究の動機と目的
- 現在のVLMが過剰な視覚的トークンにより推論時に計算コストが増加するという非効率性を是正すること。
- 特に高い削減比において顕著な性能低下を示す、従来のテキスト-視覚注目度に基づくプルーニング手法の根本的要因を特定すること。
- 視覚エンコーダー内の[CLS]トークンの注目度を活用することで、より正確で訓練フリーな視覚的トークンプルーニング手法を開発すること。
- トークンを大規模言語モデル(LLM)に入力する前にプルーニングすることで、FlashAttentionとの互換性を確保し、推論速度を最大化すること。
- LLaVA-1.5、LLaVA-NeXT、Video-LLaVAを含む多様なVLMアーキテクチャに一般化可能であることを示すこと。
提案手法
- FasterVLMは、視覚エンコーダー内における[CLS]トークンと画像トークンの間の注目度重みを用いて、視覚的トークンの重要度を評価する。これは、LLM内でのテキスト-視覚クロス注目度よりも正確である。
- LLMが処理する前に、[CLS]注目度スコアが最も低い視覚的トークンをプルーニングすることで、パイプラインの初期段階で不要な計算を排除する。
- この手法は訓練フリーであり、視覚エンコーダー内でのみ動作するため、FlashAttentionのような最適化された注目メカニズムと互換性がある。
- LLMベースのテキスト-視覚注目度に内在する注目度シフトおよび分散問題を回避し、実際のタスク関連性と整合性のとれたトークン重要度を提供する。
- グローバルな注目メカニズムを用いることで、視覚エンコーダー内に一様で信頼性の高い重要度スコアを提供する。
- LLaVA-1.5、LLaVA-NeXT、Video-LLaVAを含む複数のVLMに適用し、広範な適用可能性を示している。
実験結果
リサーチクエスチョン
- RQ1なぜ従来のテキスト-視覚注目度に基づくプルーニング手法は、高いトークン削減比において著しく性能が低下するのか?
- RQ2視覚エンコーダー内の[CLS]トークン注目度は、LLMベースのクロス注目度よりも正確で安定した視覚的トークン重要度の指標として機能できるか?
- RQ3[CLS]注目度に基づく視覚的トークンのプルーニングは、VLM推論における性能と効率のトレードオフを改善するか?
- RQ4この手法は、再訓練なしにさまざまなVLMアーキテクチャに普遍的に適用可能か?
- RQ5FlashAttention統合時における効率性と正確性の観点から、本手法は他の手法と比べてどのように差をつけるか?
主な発見
- FasterVLMは、95%の視覚的トークン削減を達成しながら、元のLLaVA-1.5-7Bの90%の性能を維持し、高い削減比において既存手法を著しく上回る。
- 10のベンチマークで、FasterVLMは9つのタスクで他の手法を上回り、残り1つのタスクでは同等の性能を示した。
- 95%のトークン削減において、FasterVLMはLLaVA-1.5-7Bで平均89.28%の精度を維持したのに対し、FlashAttentionを用いたFastVではわずか67.22%にとどまった。
- ベースライン手法と比較して、FLOPsは最大88%、推論時間は最大77%削減され、メモリオーバーヘッドは最小限に抑えられた。
- アブレーションスタディの結果、[CLS]注目度はLLMベースのテキスト-視覚注目度よりも集中性が高く、注目度シフトの影響を受けにくいことが確認された。
- LLMに入る前にプルーニングすることで、FasterVLMはFlashAttentionとの互換性を確保し、LLM内でプルーニングを行う手法よりも高速な推論を実現した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。