[論文レビュー] Youku-mPLUG: A 10 Million Large-scale Chinese Video-Language Dataset for Pre-training and Benchmarks
Youku-mPLUGは、Youkuから収集された1000万件の高品質な動画・テキストペアを備えた、公開可能な中国語の動画・言語事前学習データセットおよび包括的な人間アノテーション付きベンチマークを提供する。このデータセットで事前学習を行うことで、最先端の性能が達成され、動画カテゴリ分類では23.1%の精度向上、mPLUG-videoモデルではトップ1正解率80.5%を達成した。
To promote the development of Vision-Language Pre-training (VLP) and multimodal Large Language Model (LLM) in the Chinese community, we firstly release the largest public Chinese high-quality video-language dataset named Youku-mPLUG, which is collected from Youku, a well-known Chinese video-sharing website, with strict criteria of safety, diversity, and quality. Youku-mPLUG contains 10 million Chinese video-text pairs filtered from 400 million raw videos across a wide range of 45 diverse categories for large-scale pre-training. In addition, to facilitate a comprehensive evaluation of video-language models, we carefully build the largest human-annotated Chinese benchmarks covering three popular video-language tasks of cross-modal retrieval, video captioning, and video category classification. Youku-mPLUG can enable researchers to conduct more in-depth multimodal research and develop better applications in the future. Furthermore, we release popular video-language pre-training models, ALPRO and mPLUG-2, and our proposed modularized decoder-only model mPLUG-video pre-trained on Youku-mPLUG. Experiments show that models pre-trained on Youku-mPLUG gain up to 23.1% improvement in video category classification. Besides, mPLUG-video achieves a new state-of-the-art result on these benchmarks with 80.5% top-1 accuracy in video category classification and 68.9 CIDEr score in video captioning, respectively. Finally, we scale up mPLUG-video based on the frozen Bloomz with only 1.7% trainable parameters as Chinese multimodal LLM, and demonstrate impressive instruction and video understanding ability. The zero-shot instruction understanding experiment indicates that pretraining with Youku-mPLUG can enhance the ability to comprehend overall and detailed visual semantics, recognize scene text, and leverage open-domain knowledge.
研究の動機と目的
- ビジュアル・言語事前学習(VLP)およびマルチモーダルLLM開発を阻害する、大規模かつ高品質な公開中国語動画・言語データセットの不足に対処すること。
- 中国語における動画・言語モデルの評価に標準化された、公開可能なベンチマークが存在しない現状を克服し、公平な比較と再現可能性を向上させること。
- 厳密なフィルタリングとデータクリーニングを実施した多様性・安全性・高品質なデータセットを提供することで、中国語マルチモーダルAIにおけるより効果的な事前学習および下流アプリケーション開発を可能にすること。
- Youku-mPLUGで事前学習された、新規のモジュラリティを備えたデコーダー・オンリーアーキテクチャ(mPLUG-video)を含む、高度なマルチモーダルモデルの訓練基盤を構築すること。
- 中国語固有のデータで事前学習することで、ゼロショット指示理解および下流タスクにおける顕著な性能向上を示すことにより、その有効性を実証すること。
提案手法
- Youku(中国の大手動画共有プラットフォーム)に存在する4億件の原始的な動画からデータを収集し、複数レベルのリスク検出および手動によるキュレーションを用いて、安全性・多様性・品質の厳密なフィルタリングを実施した。
- 45の多様なカテゴリから成る1000万件の動画・テキストペアが選別され、テキストおよび動画レベルのクリーニングと中国語の画像・テキスト事前学習モデルを用いて、バランスの取れた分布と高いデータ品質を確保した。
- 36万5000件の動画を含む人間アノテーション付きベンチマークを構築し、クロスモダリティ検索、動画キャプション生成、動画カテゴリ分類の3つのタスクをカバーし、包括的な評価を可能にした。
- mPLUG-videoと呼ばれる新しいモジュラリティを備えたデコーダー・オンリーモデルを提案し、Youku-mPLUGで事前学習することで、マルチモーダル理解および推論能力を向上させた。
- Bloomzバックボーンを固定化し、学習可能なパラメータをたった1.7%に制限することで、中国語マルチモーダルLLMをスケールアップし、強力なゼロショット指示従いを実現した。
- 評価では、人間がアノテートしたケースを用いたゼロショット指示理解を実施し、mPLUG-videoをVideoLLaMAおよび事前学習を行わないmPLUG-Videoと比較した。
実験結果
リサーチクエスチョン
- RQ1大規模かつ高品質な中国語動画・言語データセットは、下流タスクにおける動画・言語モデルの性能を顕著に向上させることができるか?
- RQ2Youku-mPLUGで事前学習することで、特に視覚的意味、シーンテキスト、オープンドメイン知識の認識において、ゼロショット動画指示理解がどの程度向上するか?
- RQ3視覚と言語のモダリティが補完し合うことで、動画・言語モデルにおける検索性能にどのような影響を与えるか?
- RQ4Youku-mPLUGで事前学習されたデコーダー・オンリーアーキテクチャは、動画カテゴリ分類およびキャプション生成において最先端の結果を達成できるか?
- RQ5文化的・言語的に特異なデータセット(例:Youku-mPLUG)で事前学習することで、中国語の視覚的および言語的概念の理解と一般化能力が向上するか?
主な発見
- Youku-mPLUGで事前学習されたモデルは、ベースラインモデルと比較して、動画カテゴリ分類の精度で23.1%の向上を達成した。
- mPLUG-videoモデルは、動画カテゴリ分類で80.5%のトップ1正解率、キャプション生成で68.9のCIDErスコアという、新たな最先端性能を達成した。
- 人間による評価では、mPLUG-videoがVideoLLaMAおよび事前学習を行わないmPLUG-Videoを上回り、正しいかつ満足度の高い回答(Aランク)の割合が高かった。
- モデルは、『ジャンプする』や『ねじる』といった細かく分類された視覚的意味を理解する能力に優れ、動画内のシーンテキストを正確に認識していた。
- mPLUG-videoは、他のモデルが失敗する文脈においても、『ウルトラマン』のようなキーキャラクターを正しく同定する能力を向上させ、オープンドメイン知識を効果的に活用していた。
- Youku-mPLUGで事前学習することで、モデルの全体的な動画意味理解、詳細な視覚的手がかり、中国語の言語的ニュアンスの理解能力が顕著に向上した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。