Skip to main content
QUICK REVIEW

[論文レビュー] VideoCLIP: Contrastive Pre-training for Zero-shot Video-Text Understanding

Hu Xu, Gargi Ghosh|arXiv (Cornell University)|Sep 28, 2021
Multimodal Machine Learning Applications参考文献 59被引用数 5
ひとこと要約

VideoCLIP は、時間的に重複する動画・テキストクリップとリtrievalを用いたネガティブサンプリングを活用することで、ゼロショット動画・テキスト理解のための対照的事前学習手法を提案する。複数の動画・テキストタスクで最先端のゼロショット性能を達成しており、下流タスクのラベルを一切使用せずに、先行するゼロショット手法や一部の完全に教師ありのアプローチを上回っている。

ABSTRACT

We present VideoCLIP, a contrastive approach to pre-train a unified model for zero-shot video and text understanding, without using any labels on downstream tasks. VideoCLIP trains a transformer for video and text by contrasting temporally overlapping positive video-text pairs with hard negatives from nearest neighbor retrieval. Our experiments on a diverse series of downstream tasks, including sequence-level text-video retrieval, VideoQA, token-level action localization, and action segmentation reveal state-of-the-art performance, surpassing prior work, and in some cases even outperforming supervised approaches. Code is made available at https://github.com/pytorch/fairseq/tree/main/examples/MMPT.

研究の動機と目的

  • 下流タスクのラベルに対する微調整なしに、多様な動画・テキスト理解タスクへのゼロショット転移を可能にすること。
  • 厳密な時間的同期を要しない、ゆるい時間的重複を持つ動画とテキストクリップを用いることで、細粒度な動画・テキストアライメントを向上させること。
  • 類似した動画クラスタをリtrievalしてより難しいネガティブ例を生成することで、対照的学習におけるネガティブサンプリングを強化すること。
  • HowTo100Mで事前学習した統合型動画・テキストモデルが、シーケンスレベルおよびトークンレベルのタスクに広く一般化できるかどうかを評価すること。
  • 改善されたポジティブおよびネガティブサンプリングを用いた対照的事前学習が、ゼロショット設定で教師あり手法を上回る可能性があるかどうかを調査すること。

提案手法

  • 正確な開始・終了タイムスタンプの一致を要件としないで、時間的重複を持つ動画・テキストクリップを比較する対照的目的関数を用いて、統合型Transformerモデルを事前学習する。
  • 類似度に基づいて動画をクラスタリングすることで、リtrievalを活用した戦略により、ハードネガティブペアを含むバッチを形成し、ネガティブペアの難易度を向上させる。
  • 情報量最大化損失(例:InfoNCE)を適用し、時間的重複を持つポジティブペアがネガティブペアよりも埋め込み空間で近づくように促進する。
  • 動画とテキストの両方のための共有または別々のエンコーダーを備えた二重ストリームTransformerエンコーダーを採用し、共同表現学習を可能にする。
  • アーキテクチャのアノンに類似した動画から、近隣検索を用いてハードネガティブ例をサンプリングすることで、対照的学習の難易度を高める。
  • 手動アノテーションなしに、生の動画と字幕変換結果を用いて、HowTo100Mデータセットで事前学習を行う。

実験結果

リサーチクエスチョン

  • RQ1ゆるい時間的重複を持つ動画・テキストクリップを用いた対照的事前学習アプローチは、厳密な時間的同期を要する手法と比較して、ゼロショット動画・テキスト理解性能を向上させられるか?
  • RQ2リtrievalを活用したネガティブサンプリングは、ランダムまたはインラインネガティブサンプリングと比較して、ゼロショット動画・テキストタスクにおける一般化性能を向上させるか?
  • RQ3HowTo100Mで事前学習した統合型動画・テキストモデルは、検索、VideoQA、アクションロケーションといった多様なタスクで最先端のゼロショット性能を達成できるか?
  • RQ4ゼロショット性能は、下流データで微調整された完全に教師ありモデルの性能に、どの程度まで達するか、あるいはそれを上回れるか?
  • RQ5共有エンコーダー、[CLS]トークンの使用、リtrievalウィンドウ長といった設計選択が、モデル性能に与える影響はどの程度か?

主な発見

  • YouCook2のゼロショット設定において、テキストから動画への検索でR@1が22.7%を達成し、すべての先行ゼロショット手法を上回り、一部の完全に教師ありモデルをも上回っている。
  • リtrievalを活用したネガティブサンプリングを削除するとR@1は18.5%に低下し、リtrievalと重複クリップの両方を削除すると12.4%にまで低下する。両方の要素による相対的な性能向上は約50%に達する。
  • 複数のクリップをポジティブとして用いるMIL-NCE損失を用いた場合、R@1は16.1%にとどまり、VideoCLIPの22.7%と比べて著しく劣る。これは、本手法の目的関数がより効果的であることを示している。
  • アクションロケーションおよびセグメンテーションタスクにおいても、優れたゼロショット一般化性能を示しており、異なる粒度の動画・テキストアライメントに適応できることを裏付けている。
  • 動画とテキストの両方のTransformerエンコーダーを共有した場合、性能はわずかに低下する(R@1 21.9% vs. 22.7%)が、共同モデリングが有効であることが示された。
  • 動画の最初の32秒を検索に使用した場合、性能は悪化し(R@1 20.1%)、部分的な動画表現よりも、全体の動画表現の方が情報量が多いことが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。