[論文レビュー] Bidirectional Cross-Modal Knowledge Exploration for Video Recognition with Pre-trained Vision-Language Models
本稿では、ビデオ入力からテキスト的特徴を生成し、テキストからビデオへのアライメントを通じてカテゴリ依存の時間的重要度を抽出することにより、事前学習済み視覚言語モデル(VLM)を活用して動画認識を実現する、双方向的クロスマodal知識探索フレームワークであるBIKEを提案する。CLIPを用いた場合、Kinetics-400で88.6%の最先端の正確度を達成し、一般、ゼロショット、少サンプル認識の設定において、先行するCLIPベースの手法を上回る性能を発揮する。
Vision-language models (VLMs) pre-trained on large-scale image-text pairs have demonstrated impressive transferability on various visual tasks. Transferring knowledge from such powerful VLMs is a promising direction for building effective video recognition models. However, current exploration in this field is still limited. We believe that the greatest value of pre-trained VLMs lies in building a bridge between visual and textual domains. In this paper, we propose a novel framework called BIKE, which utilizes the cross-modal bridge to explore bidirectional knowledge: i) We introduce the Video Attribute Association mechanism, which leverages the Video-to-Text knowledge to generate textual auxiliary attributes for complementing video recognition. ii) We also present a Temporal Concept Spotting mechanism that uses the Text-to-Video expertise to capture temporal saliency in a parameter-free manner, leading to enhanced video representation. Extensive studies on six popular video datasets, including Kinetics-400 & 600, UCF-101, HMDB-51, ActivityNet and Charades, show that our method achieves state-of-the-art performance in various recognition scenarios, such as general, zero-shot, and few-shot video recognition. Our best model achieves a state-of-the-art accuracy of 88.6% on the challenging Kinetics-400 using the released CLIP model. The code is available at https://github.com/whwu95/BIKE .
研究の動機と目的
- 事前学習済み視覚言語モデル(VLM)が動画認識に限局的に利用されている問題、特にビデオからテキストへのマッチングに一方向的に依存している点を解決すること。
- VLMのクロスマodalブリッジを活用し、視覚的およびテキスト的モダリティ間で双方向の知識移転を実現すること。
- 補助的テキスト的特徴と時間的重要度を導入することで、一般、ゼロショット、少サンプル認識のシナリオにおける動画認識性能を向上させること。
- 追加の動画データでの訓練を必要とせず、動画表現を強化できる単純で効果的なフレームワークを開発すること。
提案手法
- VLMのゼロショット能力を活用して入力動画から補助的テキスト的特徴を生成するための、Video-Attributes Association機構を導入する。
- 事前に定義されたフレーズの語彙を用いて、各動画に対して最も関連性の高い特徴を抽出し、それらをAttributes Recognition Branchで利用する。
- 各フレームと指定されたカテゴリとの相関を測定することで、フレームレベルの重要度を計算するTemporal Concept Spotting機構を提案する。
- 重要度スコアを用いて動画特徴の重み付き時間的アグリゲーションを実行し、よりコンactかつ代表的な動画埋め込みを生成する。
- AttributesブランチとVideoブランチを統合した二本のストリームフレームワークであるBIKEを構築し、認識性能を共同で向上させる。
- クロスマodalアライメントのためのバックボーンとしてCLIPモデルを採用し、パラメータフリーでテキスト的および視覚的信号を統合可能にする。
実験結果
リサーチクエスチョン
- RQ1事前学習済みVLMから生成された補助的テキスト的特徴は、標準的なビデオ-テキストマッチングを上回る動画認識性能を向上させ得るか?
- RQ2テキストからビデオへの知識を活用することで、カテゴリ依存の時間的重要度を用いて動画表現をどのように向上させられるか?
- RQ3VLMから得られる双方向的クロスマodal知識探索は、ゼロショットや少サンプル設定を含む多様な動画認識シナリオにおいて一貫した向上をもたらすか?
- RQ4補助的特徴の有効性は、モデルスケールやバックボーンの能力にどの程度依存するか?
主な発見
- 提案されたBIKEフレームワークは、公開済みのCLIP ViT-B/32バックボーンを用いて、Kinetics-400データセットで88.6%の最先端のトップ-1正確度を達成した。
- Attributesブランチ単体でもKinetics-400で69%のトップ-1正確度を達成し、生成されたテキスト的特徴が補助的信号としての価値を持つことを示した。
- Attributesブランチと組み合わせた場合、Video Concept Spotting機構は性能を1.4%向上させ、動画表現の強化に有効であることを確認した。
- より大きなViT-L/14バックボーンでは、Attributesブランチに追加の利益が得られなかったため、大きなモデルはよりバランスの取れた表現を学習し、補助的特徴の必要性を低下させる傾向にあると考えられる。
- 同じViT-B/32バックボーンを用いた場合、VideoPromptおよびActionCLIPを3.0%上回った。これは、CLIPベースの動画認識において本手法の優位性を裏付けている。
- 本フレームワークは、Kinetics-400、UCF-101、HMDB-51、ActivityNet、Charadesといった複数のデータセットにおいて、一般、ゼロショット、少サンプル認識タスクで一貫した向上を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。