[论文解读] CREATE: A Benchmark for Chinese Short Video Retrieval and Title Generation
本文提出了 CREATE,这是首个针对中文短视频检索与标题生成的大规模基准数据集,包含 210K 个精细标注视频和 1000 万个弱标注视频,涵盖 51 个类别。本文提出 ALWIG 模型,该模型采用基于标签的特征融合与 GPT 解码器,联合优化视频检索与标题生成任务,在视频标题生成任务上的 CIDEr 指标相比基线模型提升了 62.5%。
Previous works of video captioning aim to objectively describe the video's actual content, which lacks subjective and attractive expression, limiting its practical application scenarios. Video titling is intended to achieve this goal, but there is a lack of a proper benchmark. In this paper, we propose to CREATE, the first large-scale Chinese shoRt vidEo retrievAl and Title gEneration benchmark, to facilitate research and application in video titling and video retrieval in Chinese. CREATE consists of a high-quality labeled 210K dataset and two large-scale 3M/10M pre-training datasets, covering 51 categories, 50K+ tags, 537K manually annotated titles and captions, and 10M+ short videos. Based on CREATE, we propose a novel model ALWIG which combines video retrieval and video titling tasks to achieve the purpose of multi-modal ALignment WIth Generation with the help of video tags and a GPT pre-trained model. CREATE opens new directions for facilitating future research and applications on video titling and video retrieval in the field of Chinese short videos.
研究动机与目标
- 为解决中文短视频标题生成与检索领域缺乏大规模、高质量基准的问题,而此类基准对社交媒体和内容创作等实际应用至关重要。
- 通过构建反映真实用户参与需求的数据集,弥合客观视频字幕与主观、吸引点击的标题风格之间的差距。
- 开发一个统一模型,通过视觉-语言对齐与生成能力,联合优化视频检索与标题生成任务。
- 通过提供丰富的标注信息,包括细粒度标签、标题与字幕,为未来中文多模态理解研究提供基础。
提出的方法
- CREATE 基于一个包含 210K 个视频的精细标注数据集(CREATE-210K)和两个大规模弱标注数据集(CREATE-3M/10M)构建,用于预训练。
- ALWIG 模型采用基于标签的融合模块,利用人工精心筛选的高质量视频标签,将视觉特征与文本表示对齐。
- 采用基于 GPT 的解码器进行文本生成,使模型能够生成富有表现力、具有点击吸引力的标题,并具备高度的语言多样性。
- 模型使用双流 BERT 编码器分别提取视觉与文本特征,随后通过交叉注意力机制进行特征融合,并使用独立解码器进行生成。
- 在 1000 万个弱标注视频上进行预训练,采用对比学习目标,以对齐视觉与语言表征。
- 该框架支持检索任务(通过 Recall@K 评估)与生成任务(通过 BLEU-4、CIDEr、Rouge-L 评估),推理阶段采用束搜索(beam search)策略。
实验结果
研究问题
- RQ1如何构建一个大规模、高质量的中文短视频检索与标题生成基准,以真实反映实际应用场景需求?
- RQ2在视觉-语言模型中,视频标签在视觉与文本模态之间的多模态对齐中,其桥梁作用在多大程度上有效?
- RQ3与单任务基线相比,联合优化视频检索与标题生成是否能同时提升两个任务的性能?
- RQ4与标准序列生成头相比,基于 GPT 的解码器在生成多样、吸引人且上下文相关视频标题方面的有效性如何?
主要发现
- 与 UniVL 基线相比,ALWIG 在视频标题生成任务上的 CIDEr 指标相对提升了 62.5%,证明了基于标签的特征融合与基于 GPT 的生成策略的有效性。
- 移除基于标签的特征融合模块后,视频标题生成的 CIDEr 下降 56%,字幕生成任务的 CIDEr 下降 56.8%,证实该模块在语义对齐中的关键作用。
- 若不使用 GPT 解码器,标题生成的 BLEU-4 下降 34.4%,字幕生成任务的 BLEU-4 下降 14.1%,表明其在学习流畅且多样的句式模式方面的重要性。
- 未进行预训练的模型在所有指标上表现均显著更差,验证了在大规模弱标注数据上进行预训练的优势。
- 所提出的基准 CREATE 包含 210K 个视频,附带 53.7 万个人工标注的标题与字幕,以及超过 5 万个细粒度标签,其标注规模是 VATEX 的 5.23 倍,T-VTD 的 2.98 倍。
- ALWIG 在视频检索、视频标题生成与字幕生成三项任务上均优于 OSCAR 与 UniVL,凸显其在联合学习中的优越性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。