Skip to main content
QUICK REVIEW

[論文レビュー] CREATE: A Benchmark for Chinese Short Video Retrieval and Title Generation

Ziqi Zhang, Yuxin Chen|arXiv (Cornell University)|Mar 31, 2022
Multimodal Machine Learning Applications被引用数 5
ひとこと要約

本稿では、51のカテゴリにまたがる21万件の高精度ラベル付き動画と1000万件の弱ラベル付き動画を備えた、中国語ショートビデオ検索およびタイトル生成のための最初の大規模ベンチマーク「CREATE」を紹介する。本研究では、タグ駆動型融合とGPTデコーダーを用いた視覚言語モデルALWIGを提案し、動画検索とタイトル生成を同時に最適化することで、ベースラインモデル比で動画タイトル生成のCIDErスコアで62.5%の向上を達成した。

ABSTRACT

Previous works of video captioning aim to objectively describe the video's actual content, which lacks subjective and attractive expression, limiting its practical application scenarios. Video titling is intended to achieve this goal, but there is a lack of a proper benchmark. In this paper, we propose to CREATE, the first large-scale Chinese shoRt vidEo retrievAl and Title gEneration benchmark, to facilitate research and application in video titling and video retrieval in Chinese. CREATE consists of a high-quality labeled 210K dataset and two large-scale 3M/10M pre-training datasets, covering 51 categories, 50K+ tags, 537K manually annotated titles and captions, and 10M+ short videos. Based on CREATE, we propose a novel model ALWIG which combines video retrieval and video titling tasks to achieve the purpose of multi-modal ALignment WIth Generation with the help of video tags and a GPT pre-trained model. CREATE opens new directions for facilitating future research and applications on video titling and video retrieval in the field of Chinese short videos.

研究の動機と目的

  • ソーシャルメディアやコンテンツ作成の実用的応用に不可欠な、中国語ショートビデオのタイトル生成および検索のための大規模かつ高品質なベンチマークの不足を解消すること。
  • 客観的な動画キャプション生成と主観的でクリックベイト風のタイトル生成の間のギャップを埋めるために、実際のユーザー参加行動のニーズを反映したデータセットを構築すること。
  • 視覚的・言語的アライメントと生成機能を統合することで、動画検索とタイトル生成の両方を同時に最適化する統合型モデルの開発。
  • 詳細なタグ、タイトル、キャプションを含む豊富なアノテーションを提供することで、今後の中国語マルチモーダル理解分野の研究基盤を提供すること。

提案手法

  • CREATEは、21万件の高精度ラベル付き動画(CREATE-210K)と、事前学習用の2つの大規模な弱ラベル付きデータセット(CREATE-3M/10M)から構成される。
  • モデルALWIGは、手動で整備された高品質な動画タグを用いて、視覚的特徴とテキスト表現をアライメントするタグ駆動型融合モジュールを採用している。
  • テキスト生成にはGPTベースのデコーダーが使用されており、流暢で多様性に富んだクリックベイト風のタイトルを生成可能である。
  • モデルは、視覚的およびテキスト的特徴抽出のための2ストリームBERTエンコーダーを用い、その後クロスアテンションによる統合と、別個のデコーダーによる生成処理を実施する。
  • 事前学習は、視覚と言語の表現をアライメントさせるためにコントラスト学習の目的関数を用いて1000万件の弱ラベル付き動画で実施される。
  • フレームワークは、検索(Recall@K)と生成(BLEU-4、CIDEr、Rouge-L)の両方のタスクをサポートしており、推論時にはビームサーチが使用される。

実験結果

リサーチクエスチョン

  • RQ1実用的応用ニーズを反映した、中国語ショートビデオ検索およびタイトル生成のための大規模かつ高品質なベンチマークをどのように構築できるか?
  • RQ2視覚的・言語的モダリティ間のマルチモーダルアライメントの橋渡しとして、動画タグがどの程度有効に機能するか?
  • RQ3動画検索とタイトル生成の両方を同時に最適化することで、単一タスクのベースラインと比較して、両タスクの性能が向上するか?
  • RQ4標準的なシーケンス生成ヘッドと比較して、GPTベースのデコーダーは、多様性に富き、魅力的で文脈的に適切な動画タイトルを生成するのにどの程度有効か?

主な発見

  • ALWIGは、UniVLベースラインと比較して、動画タイトル生成タスクでCIDErスコアに62.5%の相対的向上を達成し、タグ駆動型融合とGPTベースの生成の有効性を示した。
  • タグ駆動型融合モジュールを削除すると、動画タイトル生成でCIDErが56%低下し、キャプション生成でも56.8%低下し、そのセマンティックアライメントにおける重要性が確認された。
  • GPTデコーダーを削除すると、タイトル生成のBLEU-4スコアが34.4%低下し、キャプション生成でも14.1%低下し、流暢で多様な文構造を学習する上でその重要性が示された。
  • 事前学習を行わないモデルは、すべての指標で著しく性能が劣り、大規模な弱ラベル付きデータでの事前学習の利点が裏付けられた。
  • 提案されたベンチマークであるCREATEは、537,000件の手動アノテーション付きタイトルとキャプション、5万件以上の細分化タグを含む21万件の動画を有しており、アノテーションスケールでVATEXの5.23倍、T-VTDの2.98倍大きい。
  • ALWIGは、動画検索、動画タイトル生成、キャプション生成の3つのタスクすべてでOSCARおよびUniVLを上回り、統合学習における優位性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。