[论文解读] End-to-end Generative Pretraining for Multimodal Video Captioning
该论文提出MV-GPT,一种新颖的端到端生成式预训练框架,用于多模态视频字幕生成,通过仅使用未标注视频联合训练多模态视频编码器和句子解码器。通过利用未来话语作为监督信号,采用双向生成目标(即同时预测未来和当前话语),该模型在视频字幕生成、VideoQA、检索和动作分类任务上实现了最先进性能,且无需人工标注的字幕。
Recent video and language pretraining frameworks lack the ability to generate sentences. We present Multimodal Video Generative Pretraining (MV-GPT), a new pretraining framework for learning from unlabelled videos which can be effectively used for generative tasks such as multimodal video captioning. Unlike recent video-language pretraining frameworks, our framework trains both a multimodal video encoder and a sentence decoder jointly. To overcome the lack of captions in unlabelled videos, we leverage the future utterance as an additional text source and propose a bidirectional generation objective -- we generate future utterances given the present mulitmodal context, and also the present utterance given future observations. With this objective, we train an encoder-decoder model end-to-end to generate a caption from raw pixels and transcribed speech directly. Our model achieves state-of-the-art performance for multimodal video captioning on four standard benchmarks, as well as for other video understanding tasks such as VideoQA, video retrieval and action classification.
研究动机与目标
- 为解决大规模人工标注视频字幕的缺乏,该问题限制了生成式视频理解模型的训练。
- 实现多模态编码器与句子解码器的联合预训练,且无需人工标注字幕。
- 通过使用时间上相距较远的话语作为监督信号,开发出强于去噪自编码器的预训练目标。
- 通过端到端优化,提升在多模态视频字幕生成、VideoQA、视频检索和动作分类等下游任务上的性能。
- 证明在教学类视频中,未来话语可作为自监督学习中字幕监督的代理信号。
提出的方法
- 该框架采用双向生成目标:从当前视频和语音输入预测未来话语,以及从未来观察中预测当前话语。
- 使用特殊标记(CLS1、CLS2、BOS1、BOS2)在训练期间区分前向和后向生成任务。
- 模型在未标注的教学类视频数据集(如HowTo100M)上进行端到端训练,这些数据集包含自动语音识别(ASR)转录文本但无字幕。
- 在生成目标之外,还使用对比学习目标(Bi-NCE)以改善表征学习。
- 多模态编码器处理视觉帧和转录语音,而解码器生成自然语言字幕。
- 该框架支持迁移学习至下游任务,如视频字幕生成、VideoQA、检索和动作分类。
实验结果
研究问题
- RQ1在未标注的教学类视频中,未来话语能否有效用作多模态视频字幕生成模型端到端预训练的监督信号?
- RQ2与单向或去噪自编码方法相比,采用双向生成目标(即同时生成未来和当前话语)是否能提升性能?
- RQ3端到端训练的编码器-解码器模型是否能优于解码器随机初始化或单独预训练的模型?
- RQ4MV-GPT在视频理解下游任务(如VideoQA、检索和动作分类)上的性能提升程度如何?
- RQ5在不使用人工标注字幕的情况下,MV-GPT与其它自监督预训练方法相比表现如何?
主要发现
- MV-GPT在多模态视频字幕生成任务上达到最先进性能,在四个标准基准上均优于先前方法。
- 在MSR-VTT视频检索任务上,MV-GPT在使用ASR时达到R@1为37.3%,不使用ASR时为33.6%,相比Bi-NCE基线相对提升6.3%。
- 在MSRVTT-QA和ActivityNet-QA的VideoQA任务上,MV-GPT分别取得41.7%和39.1%的准确率,与或超过最先进模型。
- 在Kinetics-400动作分类任务上,MV-GPT从零初始化训练达到74.20%的top-1准确率,相比从零训练提升24个百分点。
- 当使用ImageNet-21k权重初始化并进一步在HowTo100M上预训练后,MV-GPT在Kinetics-400上达到80.40%的准确率,超过原始ViViT基线1.5%。
- 消融研究证实,双向生成目标相比单向或基于去噪的目标显著提升性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。