Skip to main content
QUICK REVIEW

[論文レビュー] SMAUG: Sparse Masked Autoencoder for Efficient Video-Language Pre-training

Yuanze Lin, Chen Wei|arXiv (Cornell University)|Nov 21, 2022
Multimodal Machine Learning Applications被引用数 4
ひとこと要約

SMAUGは、視覚的トークンと言語的トークンを同時にマスクし、時間的・空間的トークンの疎性を適用することで、計算コストを低減するスパースなマスク化自己符号化器フレームワークを提案する。この手法は、6つのベンチマークでテキストから動画への検索および動画質問応答のSOTAまたは競争力ある性能を達成し、1.9倍の高速化—pre-trainingにわずか約50台のNVIDIA A6000 GPU時間を要する。

ABSTRACT

Video-language pre-training is crucial for learning powerful multi-modal representation. However, it typically requires a massive amount of computation. In this paper, we develop SMAUG, an efficient pre-training framework for video-language models. The foundation component in SMAUG is masked autoencoders. Different from prior works which only mask textual inputs, our masking strategy considers both visual and textual modalities, providing a better cross-modal alignment and saving more pre-training costs. On top of that, we introduce a space-time token sparsification module, which leverages context information to further select only "important" spatial regions and temporal frames for pre-training. Coupling all these designs allows our method to enjoy both competitive performances on text-to-video retrieval and video question answering tasks, and much less pre-training costs by 1.9X or more. For example, our SMAUG only needs about 50 NVIDIA A6000 GPU hours for pre-training to attain competitive performances on these two video-language tasks across six popular benchmarks.

研究の動機と目的

  • 現在、複数のGPUを用いて数週間もかかる動画・言語pre-trainingの膨大な計算コストを低減すること。
  • pre-training中に無情報な空間的パッチや時間的に不要なフレームを特定・削除することで、動画データの冗長性に対処すること。
  • マスク化自己符号化器フレームワーク内で視覚的・言語的モダリティを同時にマスクすることで、性能を損なわず効率を向上させること。
  • 下流タスク(例:テキストから動画への検索、動画質問応答)での強力な転移性能を維持しつつ、スケーラブルでコスト効率の良いpre-trainingを可能にすること。

提案手法

  • 視覚的および言語的モダリティの両方にマスク化自己符号化器(MAE)を適用し、最大75%のパッチおよびフレームをマスクすることで、pre-training中の計算量を削減する。
  • 注意力の重みを用いて、各フレームで最も情報量の多い空間的パッチのみを保持する「時間的・空間的トークン疎性モジュール」を導入する。
  • 動的かつ学習可能なTransformerベースのセレクタを実装し、動画クリップからキーフレームを効率的に選別することで、時間的冗長性を低減する。
  • マスク化視覚モデリング(MVM)とマスク化言語モデリング(MLM)を用いてモデルを学習し、マスクされた視覚的パッチおよびテキストトークンを再構築する。
  • 軽量なデコーダーを用いて、マスクされたパッチおよびトークンを再構築し、可視で顕著なトークンのみで効率的な学習を可能にする。
  • 共同マスクと疎性処理を統合することで、pre-training時間を短縮しつつ、クロスモodalな整合性と表現品質を維持する。

実験結果

リサーチクエスチョン

  • RQ1マスク化自己符号化器フレームワーク内で視覚的・言語的モダリティを同時にマスクすることで、性能を維持しつつpre-trainingコストを顕著に削減できるか?
  • RQ2動画データの空間的および時間的冗長性をどれだけ除去しても、モデル性能が劣化しないのか?
  • RQ3学習可能なフレームセレクタは、pre-trainingに適したキーフレームをどれほど効果的に特定できるか、計算効率に与える影響は何か?
  • RQ4提案された疎性戦略は、複数のベンチマークでSOTA性能を維持しつつ、pre-training時間を1.9倍高速化できるか?

主な発見

  • SMAUGはpre-training時間を1.9倍短縮し、約50台のNVIDIA A6000 GPU時間で6つの動画・言語ベンチマークで競争力ある性能を達成した。
  • 視覚的トークン疎性において0.8の保持率を適用すると、pre-training時間は53.8時間から50.4時間に短縮され、MSRVTTのR@1はわずか0.5%低下した。
  • 4フレーム中2フレームを選択する(4→2)ことで、pre-training時間は82.5時間から77.8時間に短縮され、R@1は0.5%の低下にとどまった。
  • SMAUGの完全なパイプライン(MAE + VTS + FS)により、pre-training時間は144.5時間から77.8時間に短縮され(1.9倍高速化)、R@1は1.4%の低下にとどまった。
  • 1700万件の動画・テキストコーパス上で、SMAUGはSingularityよりR@1で2.5%の向上を達成しながら、87.1 GPU時間のコスト削減を実現し、強力なスケーラビリティを示した。
  • 定性的な結果から、フレームセレクタがキャプションと整合する関連フレームを効果的に特定しており、50%のマスク率ですら信頼できるピクセル再構築を実現していることがわかった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。