Skip to main content
QUICK REVIEW

[論文レビュー] Learning Video Representations from Textual Web Supervision

Jonathan Stroud, David A. Ross|arXiv (Cornell University)|Jul 29, 2020
Human Pose and Action Recognition参考文献 74被引用数 16
ひとこと要約

本論文は、タイトル、説明、タグ、チャンネル名などのYouTubeメタデータから得られるテキストウェブ監視情報を活用し、手動ラベルなしで動画表現を事前学習することを提案する。テキストベースの検索を用いて7000万件の動画-テキストペアを収集し、3次元畳み込みニューラルネットワーク(3D CNN)を用いて動画とテキストの埋め込みを整列させる。この手法により、アクション認識ベンチマークで最先端の性能を達成し、自己教師ありおよびクロスモーダル手法をすべて上回り、HMDB-51では8.9%、UCF-101では2.1%の向上を達成した。

ABSTRACT

Videos on the Internet are paired with pieces of text, such as titles and descriptions. This text typically describes the most important content in the video, such as the objects in the scene and the actions being performed. Based on this observation, we propose to use text as a method for learning video representations. To accomplish this, we propose a data collection process and use it to collect 70M video clips shared publicly on the Internet, and we then train a model to pair each video with its associated text. We evaluate the model on several down-stream action recognition tasks, including Kinetics, HMDB-51, and UCF-101. We find that this approach is an effective method of pre-training video representations. Specifically, it outperforms all existing methods for self-supervised and cross-modal video representation learning.

研究の動機と目的

  • 完全教師あり動画表現学習の高コストと収益の逓減を解消するため、公開動画の自由に利用可能なテキストメタデータを活用すること。
  • YouTubeの非構造的でオープンエンドなテキスト(例:タイトル、説明)が、動画表現学習のスケーラブルで効果的な監視信号として機能するかを検討すること。
  • 手動ラベルが不要な大規模な動画-テキストペアの収集パイプラインを構築すること。
  • このような弱教師あり表現が、特に低データ環境下で、下流のアクション認識タスクに効果的に一般化するかを評価すること。
  • ウェブ監視による事前学習と完全教師あり事前学習の相乗効果を調査すること。

提案手法

  • テキストベースの動画検索を用いて、タイトル、説明、タグ、チャンネル名を併せ持つ7000万件の動画クリップを収集する弱教師付きテキスト監視(WTS)データ収集プロセスを提案する。
  • 対照的学習を用いて、対応するテキスト埋め込みと整合するように動画表現を学ぶ3次元畳み込みニューラルネットワーク(3D CNN)アーキテクチャを採用する。
  • WTS-70Mデータセット上で、対応する動画とテキストペアの整合性を最大化するように、対照的損失を用いてモデルをエンドツーエンドで訓練する。
  • 下流のアクション認識データセット(Kinetics、HMDB-51、UCF-101)において、微調整とバックボーンネットワークの固定の両方を用いて学習済み表現を評価する。
  • 再現可能性と今後の研究を促進するため、7000万件の動画-テキストペアの完全なデータセットと事前学習済みモデルを公開する。
  • 個々のテキストモダリティ(例:タイトル vs. 説明)の寄与度とそれらの組み合わせ効果を分析するアブレーションスタディを実施する。

実験結果

リサーチクエスチョン

  • RQ1公開されたYouTube動画のテキストメタデータ(タイトル、説明など)は、手動ラベルなしで動画表現を事前学習するためのスケーラブルで効果的な監視信号として機能するか?
  • RQ2ウェブ監視テキストで事前学習された動画表現の性能は、標準的なアクション認識ベンチマークで、既存の自己教師ありおよびクロスモーダル手法と比較してどうなるか?
  • RQ3本手法は、クラスあたりのラベル付き例が僅かにしかないような極めて低データ環境でも、どの程度一般化するか?
  • RQ4ウェブ監視による事前学習と完全教師あり事前学習を組み合わせることで、下流の性能をさらに向上させることができるか?
  • RQ5タイトル、説明、タグなどのテキストコンポonentsのうち、学習済み動画表現の質に最も寄与するのはどれか?

主な発見

  • 提案手法は、HMDB-51で先行手法を8.9%上回る精度を達成し、UCF-101では2.1%の向上を達成した。
  • Kinetics-400およびKinetics-600では、特徴を固定した状態で72.7%および75.5%の精度を達成し、CVRLおよび他のベースラインを上回った。
  • 極めて低データ環境(例:Kinetics-600でクラスあたり平均6.5例、ラベル割合1%)においても、WTS-70M事前学習は40.9%の精度を達成し、CVRLおよびスクラッチ学習を上回った。
  • Kinetics-700事前学習と組み合わせた場合、WTS-70MはKinetics-700単体よりもHMDB-51の精度を8.5%向上させ、完全教師あり学習と強い相乗効果を示した。
  • 本手法は、音声や動画予測を用いた手法を含む、すべての既存の自己教師ありおよびクロスモーダル動画表現学習手法を上回った。
  • タイトルと説明は個別に強力な監視信号を提供し、両者の組み合わせが最も高い性能を達成した。これは、固定されたクラスラベルよりも、オープンエンドで記述的なテキストの価値が顕著であることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。