Skip to main content
QUICK REVIEW

[論文レビュー] Seeing in Flowing: Adapting CLIP for Action Recognition with Motion Prompts Learning

Qiang Wang, Junlong Du|arXiv (Cornell University)|Aug 9, 2023
Human Pose and Action RecognitionComputer Science被引用数 3
ひとこと要約

本論文では、2ストリームのモーションモデリングブロック(MMB)を用いて動きの手がかりを明示的にモデル化することで、CLIPを動画行動認識に適応する新規手法を提案する。このアプローチにより、動的プロンプト学習器が動きに敏感なプロンプト(MAP)を生成するのを支援する。提案手法は、最小限の追加パラメータと計算コストで、HMDB-51、UCF-101、Kinetics-400のすべてのベンチマークで少データ(few-shot)およびゼロショット(zero-shot)行動認識において最先端の性能を達成している。

ABSTRACT

The Contrastive Language-Image Pre-training (CLIP) has recently shown remarkable generalization on "zero-shot" training and has applied to many downstream tasks. We explore the adaptation of CLIP to achieve a more efficient and generalized action recognition method. We propose that the key lies in explicitly modeling the motion cues flowing in video frames. To that end, we design a two-stream motion modeling block to capture motion and spatial information at the same time. And then, the obtained motion cues are utilized to drive a dynamic prompts learner to generate motion-aware prompts, which contain much semantic information concerning human actions. In addition, we propose a multimodal communication block to achieve a collaborative learning and further improve the performance. We conduct extensive experiments on HMDB-51, UCF-101, and Kinetics-400 datasets. Our method outperforms most existing state-of-the-art methods by a significant margin on "few-shot" and "zero-shot" training. We also achieve competitive performance on "closed-set" training with extremely few trainable parameters and additional computational costs.

研究の動機と目的

  • 少データ環境における行動認識の限界を克服し、少データ一般化性能を向上させること。
  • CLIPにおける静的プロンプトの制限を克服し、動きに従って動的に学習するプロンプトの導入。
  • 明示的な動きモデリングとマルチモーダル連携を用いて、未学習の行動カテゴリに対するCLIPのゼロショット一般化性能を向上させること。
  • 最小限のトレーニング可能なパラメータと計算コストで、CLIPの強力な一般化性能を維持しながら高い効率性を実現すること。

提案手法

  • 動画フレーム間の表現差を分析することで、短期的および長期的動きの手がかりを捉える2ストリームのモーションモデリングブロック(MMB)を導入。
  • 抽出された動き特徴を用いて、動きに敏感なプロンプト(MAP)を生成する動的プロンプト学習器を条件づける。
  • 視覚的およびテキスト的特徴間のクロスアテンションを可能にするマルチモーダルコミュニケーションブロック(MCB)を設計。
  • CLIPの画像エンコーダー重みを凍結し、事前学習された一般化性能を保持する一方で、MMB、MAP、MCBの各コンponentのみを微調整。
  • 動きの手がかりに従ってガイドされたクローズ型テンプレートとして設計されたプロンプトを用いて、動画-テキストペア上で対照学習を実行。
  • 2段階の訓練戦略を適用:まずKinetics-400でクローズドセットモードで事前学習し、その後、さらに調整なしでHMDB-51およびUCF-101にゼロショットモードで転移。

実験結果

リサーチクエスチョン

  • RQ1明示的な動きモデリングは、データが限られた状況下でのCLIPの行動認識性能を向上させるか?
  • RQ2静的プロンプトと比較して、動きに従う動的プロンプト学習は、プロンプトの多様性と行動固有の意味的理解をどのように向上させるか?
  • RQ3コミュニケーションブロックによるマルチモーダル連携は、ゼロショットおよび少データ一般化性能をどの程度向上させるか?
  • RQ4最小限のパラメータ更新戦略は、CLIPの一般化性能を保持しつつ、標準ベンチマークで最先端の性能を達成できるか?

主な発見

  • HMDB-51では、2ショット学習下でベースライン比19.6%のトップ1精度の向上を達成し、最先端の手法を大きく上回った。
  • UCF-101では、1%の学習データで2ショットモデルが、既存の最高手法X-CLIPを+6.0%上回り、優れた少データ一般化性能を示した。
  • ゼロショット評価では、HMDB-51でX-CLIPを+5.5%、UCF-101で+4.4%上回り、データセット間転移時にはUCF-101で28.9%の大幅な向上を達成した。
  • 5ショット学習下でもKinetics-400で競争力ある性能を発揮し、学習データの1%未満で、最先端の手法を+3.0%のトップ1精度で上回った。
  • 追加パラメータはわずか420万個、追加計算量は0.03 GFLOPsにとどまり、強力な一般化性能を維持しながらも、極めて効率的であることが確認された。
  • アブレーションスタディの結果、MMB、MAP、MCBの各モジュールがそれぞれ顕著な寄与を示し、それらの組み合わせが少データおよびゼロショット両設定で最大の向上をもたらした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。