[論文レビュー] Contrastive Language-Action Pre-training for Temporal Localization
本稿では、非trimmed動画上でマスク付き対照的学習を用いて、凍結された動画エンコーダーを微調整するpost-pre-training手法である対照的言語-行動事前学習(CLAP)を提案する。CLAPは、前面の行動と背景のクリップの両方の言語記述と視覚的表現を整合させる。CLAPは、訓練中に動画エンコーダーを凍結しないことで、視覚的・言語的関係を学習し、時間的行動局所化、少サンプル時間的行動局所化、動画言語接地の最先端性能を向上させる。
Long-form video understanding requires designing approaches that are able to temporally localize activities or language. End-to-end training for such tasks is limited by the compute device memory constraints and lack of temporal annotations at large-scale. These limitations can be addressed by pre-training on large datasets of temporally trimmed videos supervised by class annotations. Once the video encoder is pre-trained, it is common practice to freeze it during fine-tuning. Therefore, the video encoder does not learn temporal boundaries and unseen classes, causing a domain gap with respect to the downstream tasks. Moreover, using temporally trimmed videos prevents to capture the relations between different action categories and the background context in a video clip which results in limited generalization capacity. To address these limitations, we propose a novel post-pre-training approach without freezing the video encoder which leverages language. We introduce a masked contrastive learning loss to capture visio-linguistic relations between activities, background video clips and language in the form of captions. Our experiments show that the proposed approach improves the state-of-the-art on temporal action localization, few-shot temporal action localization, and video language grounding tasks.
研究の動機と目的
- trimmed動画での事前学習と、下流の時間的行動局所化タスクとの間のドメインギャップを解消すること。
- 背景の文脈と言語の監視を組み込むことで、長時間の動画理解のための動画表現学習を向上させること。
- 下流タスクにおいて、未学習の行動カテゴリーや自由形式の言語クエリへの一般化を向上させること。
- 動画エンコーダーを凍結しないpost-pre-training手法を構築し、視覚的・言語的関係へのエンドツーエンドの適応を可能にすること。
- 大規模データセットへの依存を減らすために、合成および実際のキャプションを対照的学習に活用すること。
提案手法
- 初期の行動分類事前学習の後にpost-pre-trainingフェーズを導入し、対照的学習を用いて動画エンコーダーをエンドツーエンドで微調整する。
- 前面クリップおよび背景クリップの両方の記述に、実際の動画キャプションと、行動ラベルから導出された合成言語テンプレートを用いる。
- 背景の動画-言語ペアを対照的目的関数から除外するマスク付き対照的学習損失を適用し、意味的に類似したセグメントを分離させないようにする。
- 共有埋め込み空間内で、前面クリップ、背景クリップ、およびそれらに対応する言語記述の表現を対比する。
- 複数のクリップ間の時間的関係をモデル化するために、非trimmed動画を活用し、長時間の動画理解を強化する。
- 下流評価には2D-TANベースのフレームワークを用い、元の動画エンコーダーをCLAPで微調整されたものに置き換える。
実験結果
リサーチクエスチョン
- RQ1動画エンコーダーを凍結しないpost-pre-training手法は、標準的な事前学習を上回る時間的行動局所化性能を達成できるか?
- RQ2事前学習段階で背景の動画クリップと言語記述を組み込むことで、未学習の行動や言語クエリへの一般化性能が向上するか?
- RQ3背景ペアを除外するマスク付き対照的学習は、標準的な対照的アプローチと比較して表現学習を改善するか?
- RQ4CLAPは、限られた事前学習データで少サンプル時間的行動局所化および動画言語接地で最先端性能を達成できるか?
- RQ5合成プロンプトと実際のキャプションの選択が、異なるデータセット間での転移性能に与える影響は何か?
主な発見
- Charades-STAでは、IoU@0.5におけるリCALLが49.24を達成し、同じ設定で2D-TAN(42.8)とTSP(51.71)を上回った。
- TACoSでは、平均IoUが25.70を記録し、TSP(24.91)を上回り、2D-TAN(平均IoUはN.A.)を上回った。
- CLAP(mask)は、Charades-STAでIoU@0.5におけるリCALLを53.14に達成し、TSP(51.71)と2D-TAN(47.59)を上回った。
- 合成プロンプトを前面および背景クリップに使用するCLAP†バージョンは、Charades-STA(25.70)およびTACoS(25.70)で最高の平均IoUを記録し、一般化性能の向上を示した。
- CLAPは、より良いクロスモodalな整合性と時間的文脈モデリングを学習することで、少サンプル時間的行動局所化の性能を向上させた。
- モデルは強力なゼロショット一般化を示し、ロープジャンプなどの行動をTSPよりも早く正しく局所化した。これは、活動の文脈に対するより良い意味的理解を示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。