Skip to main content
QUICK REVIEW

[論文レビュー] Advancing High-Resolution Video-Language Representation with Large-Scale Video Transcriptions

Hongwei Xue, Tiankai Hang|arXiv (Cornell University)|Nov 19, 2021
Multimodal Machine Learning Applications参考文献 58被引用数 6
ひとこと要約

本稿では、15のYouTubeカテゴリから得た100Mの動画文対と371.5K時間の720p動画を活用した高解像度で多様性のある動画言語事前学習モデルHD-VILAを紹介する。ハイブリッドTransformerを用いて高解像度および低解像度のフレームを統合的に符号化し、マルチモーダル埋め込みをエンド・トゥ・エンドで最適化することで、HD-VILAは最先端の性能を達成し、ゼロショットテキスト対動画検索でR@1に40.4%の相対的向上を達成するとともに、高解像度LSMDCでは55.4%の向上を示した。

ABSTRACT

We study joint video and language (VL) pre-training to enable cross-modality learning and benefit plentiful downstream VL tasks. Existing works either extract low-quality video features or learn limited text embedding, while neglecting that high-resolution videos and diversified semantics can significantly improve cross-modality learning. In this paper, we propose a novel High-resolution and Diversified VIdeo-LAnguage pre-training model (HD-VILA) for many visual tasks. In particular, we collect a large dataset with two distinct properties: 1) the first high-resolution dataset including 371.5k hours of 720p videos, and 2) the most diversified dataset covering 15 popular YouTube categories. To enable VL pre-training, we jointly optimize the HD-VILA model by a hybrid Transformer that learns rich spatiotemporal features, and a multimodal Transformer that enforces interactions of the learned video features with diversified texts. Our pre-training model achieves new state-of-the-art results in 10 VL understanding tasks and 2 more novel text-to-visual generation tasks. For example, we outperform SOTA models with relative increases of 40.4% R@1 in zero-shot MSR-VTT text-to-video retrieval task and 55.4% in high-resolution dataset LSMDC. The learned VL embedding is also effective in generating visually pleasing and semantically relevant results in text-to-visual editing and super-resolution tasks.

研究の動機と目的

  • 既存の動画言語事前学習モデルが低品質な動画特徴量と限られたテキスト多様性に依存するという制限を是正すること。
  • 高解像度(720p)の動画と現実世界の多様なYouTubeコンテンツを活用することで、より効果的なクロスモダリティ学習を可能にすること。
  • 時間的・空間的動画表現とマルチモーダル言語-動画埋め込みをエンド・トゥ・エンドで統合的に最適化する統一フレームワークの開発。
  • 新規データセットとモデルを通じて、高解像度、大規模、多様性のある動画言語理解のための新基準を確立すること。

提案手法

  • 著者らは、15の多様なカテゴリにまたがる330万本の720p YouTube動画から得た1億件の動画文対を含む大規模データセットHD-VILA-100Mを収集した。
  • ハイブリッド画像シーケンス戦略を採用し、高解像度(HR)フレームをランダムに抽出し、周囲の時間的位置から低解像度(LR)フレームを均等にサンプリングした。
  • ハイブリッドTransformerネットワークにより、HRおよびLRフレームを別々に符号化し、両者の特徴量を共有埋め込み空間にマップすることで、空間的詳細と時間的整合性を両立させた。
  • マルチモーダルTransformerを用いて、エンド・トゥ・エンドの方法で動画と言語表現を統合的に最適化し、モダリティ間の豊富なクロスアテンションを可能にした。
  • 本フレームワークは、テキスト対動画検索、動画質疑応答、テキスト対視覚生成といった下流タスクへのゼロショット転送をサポートする。
  • データセットは、著作権上の懸念から生データを公開しないが、Open Use of Data Agreementに基づき動画URLとメタデータを公開した。
Figure 1 : Examples of video clips and ASR generated transcriptions in the proposed HD-VILA-100M dataset. We present six samples (four frames for each), with diverse video categories covering HowTo & Style, People & Blog, Sports, Travel & Event, Pets & Animals, Film & Animation. Relevant words from
Figure 1 : Examples of video clips and ASR generated transcriptions in the proposed HD-VILA-100M dataset. We present six samples (four frames for each), with diverse video categories covering HowTo & Style, People & Blog, Sports, Travel & Event, Pets & Animals, Film & Animation. Relevant words from

実験結果

リサーチクエスチョン

  • RQ1低解像度ベースラインと比較して、高解像度の動画入力を用いることで、動画言語表現学習が顕著に向上するか?
  • RQ2動画コンテンツの意味的多様性が増加することで、下流の動画言語タスクにおける一般化性能と性能が向上するか?
  • RQ3時間的・空間的動画特徴量とマルチモーダル埋め込みのエンド・トゥ・エンド統合学習は、段階的または二ストリームアーキテクチャを上回るか?
  • RQ4大規模で多様性に富み、高品質な動画言語データセットは、ゼロショットおよびフェイシュート転送性能をどの程度向上させるか?
  • RQ5提案されたハイブリッドフレーム符号化戦略(HR + LR)は、視覚的詳細と時間的ダイナミクスの両方を効果的に保持できるか?

主な発見

  • HD-VILAは、ゼロショットMSR-VTTテキスト対動画検索ベンチマークにおいて、R@1で40.4%の相対的向上を達成し、先行する最先端モデルを上回った。
  • 高解像度LSMDCデータセットでは、検索性能で55.4%の相対的向上を達成し、高品質な動画入力への強力な一般化能力を示した。
  • 動画質疑応答やキャプション生成を含む10の動画言語理解タスクで、すべてにおいて最先端の結果を達成した。
  • 学習された動画言語埋め込みは、意味的に関連性があり、視覚的に妥当な出力を生成する高品質なテキスト対視覚編集およびスーパーレンダリングを可能にした。
  • HD-VILA-100Mデータセットは、371.5K時間の720p動画と15の多様なカテゴリを含み、これまでで最大規模かつ最高解像度の動画言語データセットである。
  • モデルの性能向上は、高解像度入力、多様なコンテンツ、エンド・トゥ・エンドのマルチモーダル最適化の組み合わせに起因する。
Figure 2 : The distribution of categories in HD-VILA-100M dataset: (a) video, (b) video clip. [Best viewed in Color]
Figure 2 : The distribution of categories in HD-VILA-100M dataset: (a) video, (b) video clip. [Best viewed in Color]

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。