[论文解读] Youku-mPLUG: A 10 Million Large-scale Chinese Video-Language Dataset for Pre-training and Benchmarks
Youku-mPLUG 提供了目前最大的公开中文视频-文本预训练数据集,包含从优酷平台收集的1000万条高质量视频-文本对,以及一个全面的人工标注基准,用于视频-文本检索、字幕生成和分类任务。在该数据集上进行预训练可实现最先进性能,包括视频类别分类准确率提升23.1%,以及 mPLUG-video 模型在视频分类任务中达到80.5%的 top-1 准确率。
To promote the development of Vision-Language Pre-training (VLP) and multimodal Large Language Model (LLM) in the Chinese community, we firstly release the largest public Chinese high-quality video-language dataset named Youku-mPLUG, which is collected from Youku, a well-known Chinese video-sharing website, with strict criteria of safety, diversity, and quality. Youku-mPLUG contains 10 million Chinese video-text pairs filtered from 400 million raw videos across a wide range of 45 diverse categories for large-scale pre-training. In addition, to facilitate a comprehensive evaluation of video-language models, we carefully build the largest human-annotated Chinese benchmarks covering three popular video-language tasks of cross-modal retrieval, video captioning, and video category classification. Youku-mPLUG can enable researchers to conduct more in-depth multimodal research and develop better applications in the future. Furthermore, we release popular video-language pre-training models, ALPRO and mPLUG-2, and our proposed modularized decoder-only model mPLUG-video pre-trained on Youku-mPLUG. Experiments show that models pre-trained on Youku-mPLUG gain up to 23.1% improvement in video category classification. Besides, mPLUG-video achieves a new state-of-the-art result on these benchmarks with 80.5% top-1 accuracy in video category classification and 68.9 CIDEr score in video captioning, respectively. Finally, we scale up mPLUG-video based on the frozen Bloomz with only 1.7% trainable parameters as Chinese multimodal LLM, and demonstrate impressive instruction and video understanding ability. The zero-shot instruction understanding experiment indicates that pretraining with Youku-mPLUG can enhance the ability to comprehend overall and detailed visual semantics, recognize scene text, and leverage open-domain knowledge.
研究动机与目标
- 为解决视觉-语言预训练(VLP)和多模态大模型发展过程中缺乏大规模、高质量公开中文视频-语言数据集的问题。
- 克服当前缺乏标准化、公开可用的中文视频-语言模型评估基准,导致公平比较与可复现性受限的问题。
- 通过提供多样化、安全且高质量的数据集,并辅以严格过滤与数据清洗,推动中文多模态人工智能更有效的预训练与下游应用开发。
- 为训练先进多模态模型奠定基础,包括一种新型模块化仅解码器架构(mPLUG-video),该模型在 Youku-mPLUG 上进行预训练。
- 通过显著提升零样本指令理解与下游任务性能,证明在中文特定数据上预训练的有效性。
提出的方法
- 数据集从优酷平台的4亿条原始视频中收集,优酷是中国主要的视频分享平台,通过多级风险检测与人工校对,对安全性、多样性与质量进行严格过滤。
- 从45个不同类别中筛选出1000万条视频-文本对,通过文本与视频层级的清洗,以及使用中文图文预训练模型,确保类别分布均衡且数据质量高。
- 构建了一个包含36.5万条视频的人工标注基准,用于三项任务:跨模态检索、视频字幕生成与视频类别分类,支持全面评估。
- 提出一种新型模块化仅解码器模型 mPLUG-video,并在 Youku-mPLUG 上进行预训练,以增强多模态理解与推理能力。
- 通过仅微调1.7%参数的冻结 Bloomz 主干网络,进一步扩展模型规模,构建出强大的中文多模态大模型,实现出色的零样本指令遵循能力。
- 评估包括使用人工标注案例的零样本指令理解任务,将 mPLUG-video 与未预训练的 VideoLLaMA 和 mPLUG-Video 进行对比。
实验结果
研究问题
- RQ1大规模、高质量的中文视频-语言数据集是否能显著提升视频-语言模型在下游任务中的性能?
- RQ2在 Youku-mPLUG 上进行预训练在多大程度上提升了零样本视频指令理解能力,特别是对视觉语义、场景文字与开放领域知识的识别能力?
- RQ3视觉与语言模态之间的互补性在多大程度上影响视频-语言模型的检索性能?
- RQ4在 Youku-mPLUG 上预训练的仅解码器架构能否在视频类别分类与字幕生成任务中达到最先进性能?
- RQ5在文化与语言特性特定的数据集(如 Youku-mPLUG)上进行预训练,是否能带来对中文视觉与语言概念更优的泛化与理解能力?
主要发现
- 在 Youku-mPLUG 上预训练的模型相比基线模型,视频类别分类准确率提升了23.1%。
- mPLUG-video 模型在视频类别分类任务中达到80.5%的 top-1 准确率,在视频字幕生成任务中取得68.9的 CIDEr 得分,创下新最先进水平。
- 人工评估显示,mPLUG-video 在零样本指令理解任务中优于 VideoLLaMA 与未预训练的 mPLUG-Video,具有更高比例的正确且令人满意的回答(A级)。
- 该模型展现出更强的理解细粒度视觉语义的能力,例如准确识别 '跳跃' 和 '扭曲' 等动作。
- mPLUG-video 在利用开放领域知识方面表现更优,能正确识别出视频语境中关键角色如 '奥特曼',而其他模型则失败。
- 在 Youku-mPLUG 上进行预训练显著提升了模型对整体视频语义、细节视觉线索与中文语言细微差别的理解能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。