Skip to main content
QUICK REVIEW

[論文レビュー] Expanding Language-Image Pretrained Models for General Video Recognition

Bolin Ni, Houwen Peng|arXiv (Cornell University)|Aug 4, 2022
Multimodal Machine Learning Applications被引用数 16
ひとこと要約

本稿では、CLIP や Florence などの事前学習済み言語・画像モデルを一般動画認識に適応させるための X-CLIP を提案する。時間的モデリングのための軽量なクロスフレームアテンション機構と、学習可能な動画固有のプロンプトスキームを導入している。この手法は、12×少ない FLOPs で ViViT-H を上回る性能を示し、ゼロショット(SOTA より +14.9% のトップ1正解率)、few-shot(+32.1% の向上)、完全教師あり(Kinetics-400 で 87.1% のトップ1正解率)の設定で最先端の性能を達成した。

ABSTRACT

Contrastive language-image pretraining has shown great success in learning visual-textual joint representation from web-scale data, demonstrating remarkable "zero-shot" generalization ability for various image tasks. However, how to effectively expand such new language-image pretraining methods to video domains is still an open problem. In this work, we present a simple yet effective approach that adapts the pretrained language-image models to video recognition directly, instead of pretraining a new model from scratch. More concretely, to capture the long-range dependencies of frames along the temporal dimension, we propose a cross-frame attention mechanism that explicitly exchanges information across frames. Such module is lightweight and can be plugged into pretrained language-image models seamlessly. Moreover, we propose a video-specific prompting scheme, which leverages video content information for generating discriminative textual prompts. Extensive experiments demonstrate that our approach is effective and can be generalized to different video recognition scenarios. In particular, under fully-supervised settings, our approach achieves a top-1 accuracy of 87.1% on Kinectics-400, while using 12 times fewer FLOPs compared with Swin-L and ViViT-H. In zero-shot experiments, our approach surpasses the current state-of-the-art methods by +7.6% and +14.9% in terms of top-1 accuracy under two popular protocols. In few-shot scenarios, our approach outperforms previous best methods by +32.1% and +23.1% when the labeled data is extremely limited. Code and models are available at https://aka.ms/X-CLIP

研究の動機と目的

  • 事前学習済み言語・画像モデルを再訓練なしで動画認識に適応すること。
  • 軽量でプラグイン可能なモジュールを用いて、動画フレーム間の長距離時間的依存関係を効率的にモデリングすること。
  • 動画の内容情報を統合することで、より判別力のあるテキストプロンプトを生成し、ゼロショットおよび few-shot での一般化性能を向上させること。
  • ゼロショット、few-shot、完全教師ありの多様な動画認識シナリオへの効果的な転送を可能にすること。

提案手法

  • フレーム間の明示的かつ効率的な情報交換を可能にするメッセージトークンを用いたクロスフレーム通信トランスフォーマーを導入し、フレームレベルの表現を保持する。
  • フレームレベル特徴量を統合して一貫した動画レベルの表現を生成するためのマルチフレーム統合トランスフォーマーを採用する。
  • 意味的ラベルと動画の内容特徴を組み合わせて、適応的かつ判別力のあるテキストプロンプトを生成する、学習可能な動画固有のプロンプト生成機構を提案する。
  • 訓練および推論時にスパarsなサンプリング戦略を採用し、密なサンプリングを上回る性能を示し、視点数の変動に対してもロバストであることを確認した。
  • マルチビュー推論を適用することで、特にゼロショットおよび few-shot の設定において性能を向上させ、事前学習済み言語・画像エンコーダーのロバスト性を活用した。
  • 画像エンコーダーとテキストエンコーダーの両方をエンドツーエンドで微調整可能であり、アブレーションスタディにより、ゼロショットおよび完全教師あり設定で両方を微調整した場合に最良の性能が得られることを示した。

実験結果

リサーチクエスチョン

  • RQ1事前学習済み言語・画像モデルを完全再訓練なしで動画認識に効果的に適応できるか?
  • RQ2軽量でプラグイン可能なモジュールを用いて、フレーム間の時間的依存関係を効率的にモデリングできるか?
  • RQ3動画の内容に依存するプロンプト生成により、ゼロショットおよび few-shot 動画認識におけるテキスト表現の判別力が向上するか?
  • RQ4本フレームワークにおいて、最適なサンプリング戦略(密サンプリング対スパースサンプリング)は何か?
  • RQ5画像エンコーダーを固定するか、テキストエンコーダーを固定するかといった異なる微調整戦略が、ゼロショット、few-shot、完全教師あり設定における性能に与える影響は何か?

主な発見

  • X-CLIP は完全教師あり学習において Kinetics-400 で 87.1% のトップ1正解率を達成し、ViViT-H よりも 2.3% 高く、FLOPs は 12×少ない。
  • ゼロショット評価では、X-Florence が ActionCLIP よりも 2 つの標準プロトコルでそれぞれ +7.6% と +14.9% の上回りを記録した。
  • 極めて限られたラベル付きデータを用いた few-shot 学習では、先行研究の最良手法よりそれぞれ +32.1% と +23.1% の向上を達成した。
  • 提案された動画固有のプロンプト生成機構により、CLIP-Mean ベースライン比で +2.3% の性能向上が得られ、判別力のあるテキストプロンプトの生成効果が実証された。
  • 訓練および推論時にスパースサンプリングを採用することで、密サンプリングを上回る性能が安定して得られ、1視点推論でも 10 視点推論と同等の結果を達成した。これは、強力な表現力に起因する。
  • ゼロショット設定では、画像エンコーダーとテキストエンコーダーの両方を微調整した場合が最良の結果を示したが、few-shot ではテキストエンコーダーのみを微調整した場合が最良の性能を示し、データが限られた状況ではテキストエンコーダーの過学習リスクが低いことが示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。