[论文解读] Multimodal Pretraining for Dense Video Captioning
本文提出了 ViTT,一个大规模、多样化的数据集,包含 8,000 段带时间戳的视频片段标注,以及针对密集视频字幕任务的多模态预训练策略——特别是基于 ASR 转录文本和视觉特征的 MASS 风格联合编码器-解码器预训练方法。该方法在 YouCook2 数据集上达到最先进性能,并在 ViTT 上展现出强大的泛化能力,表明仅使用 ASR 信号进行文本预训练可带来主要性能提升,而多模态预训练仅带来微小改进。
Learning specific hands-on skills such as cooking, car maintenance, and home repairs increasingly happens via instructional videos. The user experience with such videos is known to be improved by meta-information such as time-stamped annotations for the main steps involved. Generating such annotations automatically is challenging, and we describe here two relevant contributions. First, we construct and release a new dense video captioning dataset, Video Timeline Tags (ViTT), featuring a variety of instructional videos together with time-stamped annotations. Second, we explore several multimodal sequence-to-sequence pretraining strategies that leverage large unsupervised datasets of videos and caption-like texts. We pretrain and subsequently finetune dense video captioning models using both YouCook2 and ViTT. We show that such models generalize well and are robust over a wide variety of instructional videos.
研究动机与目标
- 为解决密集视频字幕任务中缺乏大规模、多样化数据集的问题,构建并发布 ViTT,一个包含 8,000 段教学视频及时间戳片段标注的新基准。
- 通过利用更广泛的教学视频内容,提升密集视频字幕模型在烹饪等狭窄领域之外的泛化能力。
- 研究多模态预训练策略(尤其是联合编码器-解码器预训练)在视频片段字幕生成任务中的有效性。
- 评估在大规模、无监督视频与文本数据上进行预训练是否能提升模型在多样化教学视频领域中的性能与鲁棒性。
- 在已建立的 YouCook2 基准和新引入的 ViTT 基准上建立强有力的性能基线。
提出的方法
- 作者构建了 ViTT,一个包含 8,000 段教学视频的新数据集,平均每段视频标注 7.1 个时间戳片段,涵盖烹饪、维修、保养等主题。
- 采用 MASS 风格的预训练方法,利用来自 ASR 转录文本和从教学视频中提取的视觉特征的无监督信号,联合微调多模态编码器与文本解码器。
- 预训练在大规模弱监督数据上进行,包括 YouTube-8M(烹饪视频)、Recipe1M(纯文本食谱)和 WikiHow(纯文本操作指南),且无需成对的视频-文本监督。
- 模型架构采用视频编码器(如 I3D 或 S3D)和文本解码器(如 BERT 风格的 Transformer),通过掩码序列建模联合预训练,以预测两种模态流中被掩码的标记。
- 在微调阶段,假设片段边界已知,模型使用单向或双向解码方式为每个片段生成描述性字幕。
- 该方法在预训练阶段同时利用视频与文本信号,通过消融实验隔离各模态及预训练策略的贡献。
实验结果
研究问题
- RQ1使用大规模、弱监督的视频与文本数据进行多模态预训练,是否能显著提升在多样化教学视频上的密集视频字幕性能?
- RQ2与多模态预训练(视频 + 文本)相比,仅使用文本信号(如 ASR 转录)进行预训练,在性能与泛化能力方面表现如何?
- RQ3所提出的预训练策略在原始 YouCook2 基准之外的泛化程度如何,特别是在更广泛、更多样化的数据集 ViTT 上?
- RQ4通过 MASS 风格目标联合预训练编码器与解码器,是否优于 BERT 风格方法中分别预训练编码器与解码器的方式?
- RQ5视觉特征与 ASR 衍生的文本信号在提升字幕生成性能方面,各自贡献如何?
主要发现
- 所提模型在 YouCook2 基准上达到新的最先进 ROUGE-L 得分 38.80,优于先前方法。
- 在更具多样性的 ViTT 基准上,模型取得 ROUGE-L 得分 31.5,表明尽管难度更高,仍具备强大泛化能力。
- 仅使用 ASR 转录文本进行文本预训练带来了绝大部分性能提升,而多模态预训练仅带来微小改进(ROUGE-L 提升不足 1 分)。
- YouCook2 与 ViTT 之间的性能差距在各种预训练条件下保持一致,表明模型在不同教学视频领域间具有良好的泛化能力。
- 使用对齐或排序任务(MASSalign)的预训练仅带来有限改进,表明此类目标在字幕生成任务中不如掩码序列建模有效。
- 使用 3D 视觉特征与 2D 特征相比,性能无显著差异,支持在实际应用中使用更简单的 2D 特征。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。