Skip to main content
QUICK REVIEW

[論文レビュー] CrossGET: Cross-Guided Ensemble of Tokens for Accelerating Vision-Language Transformers

Dachuan Shi, Chaofan Tao|arXiv (Cornell University)|May 27, 2023
Multimodal Machine Learning Applications被引用数 5
ひとこと要約

CrossGET は、クロスモーダルなガイドと完全グラフソフトマッチングを用いて、自己適応的にトークンを削減することで、ビジョン・ランゲージ変換器の高速化を実現する汎用フレームワークです。最大 2.94 倍の FLOP 減少を達成し、精度の低下は最小限(例:BLIP では -5.19%)に抑えられ、多様なタスクおよびモデルにおいて高いパフォーマンスを維持します。

ABSTRACT

Recent vision-language models have achieved tremendous advances. However, their computational costs are also escalating dramatically, making model acceleration exceedingly critical. To pursue more efficient vision-language Transformers, this paper introduces Cross-Guided Ensemble of Tokens (CrossGET), a general acceleration framework for vision-language Transformers. This framework adaptively combines tokens in real-time during inference, significantly reducing computational costs while maintaining high performance. CrossGET features two primary innovations: 1) Cross-Guided Matching and Ensemble. CrossGET leverages cross-modal guided token matching and ensemble to effectively utilize cross-modal information, achieving wider applicability across both modality-independent models, e.g., CLIP, and modality-dependent ones, e.g., BLIP2. 2) Complete-Graph Soft Matching. CrossGET introduces an algorithm for the token-matching mechanism, ensuring reliable matching results while facilitating parallelizability and high efficiency. Extensive experiments have been conducted on various vision-language tasks, such as image-text retrieval, visual reasoning, image captioning, and visual question answering. The performance on both classic multimodal architectures and emerging multimodal LLMs demonstrates the framework's effectiveness and versatility. The code is available at https://github.com/sdc17/CrossGET.

研究の動機と目的

  • 大規模ビジョン・ランゲージ変換器の計算コストの増大、特にリソース制約下での課題に対処すること。
  • マルチモーダルでクロスアテンションベースのモデルに特化した有効なトークン削減技術の不足を克服すること。
  • モダリティに依存しない(例:CLIP)およびモダリティに依存する(例:BLIP)アーキテクチャの両方において、効率的な推論を可能にすること。
  • 最小限のパフォーマンス劣化と無視できるパrameterオーバーヘッドで高い加速を達成すること。
  • リアルタイムでの低スペックデバイスへのデプロイが可能な、汎用的でトレーニング可能かつデプロイ可能なフレームワークを提供すること。

提案手法

  • クロスガイドドマッチングとアンサンブルの導入:クロスモーダルなトークンを軽量なエージェントとして用い、モダリティ内でのトークン選択と重み付きアンサンブルをガイドすることで、双方向のクロスモーダル情報利用を可能にします。
  • 完全グラフソフトマッチングの採用:二部グラフ手法よりも信頼性の高いマッチングを実現する完全グラフマッチングポリシーを近似し、並列性と効率性を維持します。
  • 再トレーニングを必要とせず、推論時のみにフレームワークを適用することで、計算リソースの予算に応じた動的モデル圧縮を可能にします。
  • ビジョンおよび言語の両ブランチに最小限のクロスアテンションパラメータを挿入し、トークン選択のためのクロスモーダル重要度スコアを計算します。
  • 学習された重要度スコアを用いてマッチドトークンの重み付きアンサンブルを実行し、モデル表現の忠実性を保持します。
  • ゼロショットおよび微調整済みモデルへの適応をサポートし、再トレーニングなしで異なる圧縮比での再評価が可能になります。

実験結果

リサーチクエスチョン

  • RQ1クロスモーダルなガイドにより、ビジョン・ランゲージ変換器における不要なトークンを効果的に同定し、効率的な推論を実現できるか?
  • RQ2完全グラフソフトマッチングポリシーは、二部グラフマッチングと比較して、マッチングの信頼性を向上させつつ並列性を維持できるか?
  • RQ3CrossGET は、アーキテクチャの変更なしに、モダリティに依存しないおよびモダリティに依存する両方のビジョン・ランゲージモデルに普遍的に適用可能か?
  • RQ4CrossGET は、多様なビジョン・ランゲージタスクにおいて、どの程度 FLOPs を削減しつつパフォーマンスを維持できるか?
  • RQ5フレームワークは、再トレーニングや微調整なしに、推論時に動的モデル圧縮を可能にするか?

主な発見

  • Visual Reasoning タスク(NVLR2 データセット)における BLIP では、トレーニング済みで最大 2.94 倍の FLOP 減少を達成し、精度はわずか 5.19% の低下に抑えられ、微調整なしでは 2.26 倍の削減を実現しました。
  • Image-Text Retrieval タスクにおける CLIP では、微調整なしに 1.04 倍の推論スピードアップ(12.56 GFLOPs)を達成し、Recall@1 が 86.20% を維持し、元のモデルを効率性において上回りました。
  • フレームワークにより、一度トレーニングしたモデルを複数の圧縮比で再評価可能であり、異なる推論予算において 1.04 倍から 2.94 倍のスピードアップが達成されました。
  • タスク全体を通じて FLOPs を 1.71 倍から 2.94 倍まで削減しながら、類似した圧縮レベルにおけるベースラインモデルと比較して、精度を維持またはわずかに向上させました。
  • 完全グラフソフトマッチングポリシーはマッチングの信頼性を向上させ、二部グラフマッチングに比べてより一貫したパフォーマンス向上をもたらしました。
  • CrossGET は無視できるパrameterオーバーヘッド(例:0.1% 未満の追加パラメータ)を導入しており、リソース制約のあるデバイスへの効率的かつ実用的なデプロイが可能です。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。