[论文解读] Learning Audio-Video Modalities from Image Captions
本文提出了一种可扩展的视频挖掘流水线,通过视觉相似性将图像字幕数据集(例如,Conceptual Captions3M)中的字幕迁移至视频和音频片段,从而构建了一个大规模、弱监督的音视频字幕数据集 VideoCC3M。在该数据集上预训练多模态Transformer模型,可在视频检索和字幕生成任务上实现最先进性能,且仅需 HowTo100M 数据集所需数据量的 1/20 视频片段和 1/100 的字幕数量。此外,该方法还实现了强大的零样本泛化能力,并在音频检索基准测试中取得最先进结果。
A major challenge in text-video and text-audio retrieval is the lack of large-scale training data. This is unlike image-captioning, where datasets are in the order of millions of samples. To close this gap we propose a new video mining pipeline which involves transferring captions from image captioning datasets to video clips with no additional manual effort. Using this pipeline, we create a new large-scale, weakly labelled audio-video captioning dataset consisting of millions of paired clips and captions. We show that training a multimodal transformed based model on this data achieves competitive performance on video retrieval and video captioning, matching or even outperforming HowTo100M pretraining with 20x fewer clips. We also show that our mined clips are suitable for text-audio pretraining, and achieve state of the art results for the task of audio retrieval.
研究动机与目标
- 为解决大规模、弱监督音视频字幕数据集的缺乏问题,该问题限制了文本-视频与文本-音频检索任务的进展。
- 开发一种可扩展、自动化的流水线,无需人工标注即可将图像字幕迁移至视频和音频片段。
- 构建一个大规模、弱配对的音视频字幕数据集,适用于多模态模型的预训练。
- 证明在挖掘得到的数据上预训练的模型,相较于在 HowTo100M 上预训练的模型,可在零样本设置下实现更具竞争力或更优的性能。
- 表明挖掘得到的数据在下游音频检索任务中支持优异性能,在 AudioCaps 和 Clotho 基准上均达到最先进水平。
提出的方法
- 使用图像字幕数据集(如 CC3M)中的图像作为‘种子’帧,通过基于 CLIP 的图像编码器在视频中识别视觉上相似的帧。
- 对于每个匹配的帧,提取以该帧为中心的短时视频片段(含音频),形成弱监督的音视频片段对。
- 将原始图像字幕直接迁移至挖掘得到的视频片段作为弱监督信号,生成音视频-文本配对样本。
- 在生成的 VideoCC3M 数据集上端到端训练多模态音视频Transformer模型,用于视频检索与字幕生成。
- 在下游基准(如 HowTo100M、AudioCaps 和 Clotho)上微调模型,以评估零样本与微调后的性能表现。
- 使用仅音频和音视频融合编码器,评估视觉模态对音频检索性能的贡献。
实验结果
研究问题
- RQ1我们能否仅通过视觉相似性,从现有的图像字幕数据集中自动挖掘大规模、弱监督的音视频字幕数据?
- RQ2与在 HowTo100M 上预训练相比,基于挖掘得到的 VideoCC3M 数据集进行预训练,是否能在视频检索与字幕生成任务中取得更优性能,尤其是在数据量显著减少的情况下?
- RQ3挖掘得到的音视频数据是否能支持视频与音频检索任务中的强大零样本泛化能力?
- RQ4在使用挖掘得到的字幕时,引入视觉模态是否能提升音频检索任务的性能?
- RQ5在 VideoCC3M 上训练的模型是否能在 AudioCaps 和 Clotho 等标准音频检索基准上实现最先进结果?
主要发现
- VideoCC3M 数据集包含数百万个通过图像字幕数据作为种子,从网络视频中自动挖掘得到的弱配对音视频-文本片段。
- 在 VideoCC3M 上预训练的模型在视频检索与字幕生成任务中表现优异,仅使用 HowTo100M 所需数据量的 1/20 视频片段和 1/100 的文本句子,即可达到或超越其性能。
- 该模型在音频检索任务中取得最先进结果,在 AudioCaps 上的 R@1 达到 32.0,较之前最先进方法提升 7.7 分,且无需任何人工音频-文本标注。
- 在 VideoCC3M 上预训练可显著提升模型在视频字幕与检索任务中的零样本性能,优于在 HowTo100M 上预训练的模型,后者因领域偏移问题在零样本设置下表现较差。
- 音视频融合能提升音频检索性能,最佳结果通过结合 VideoCC3M 预训练与 AudioCaps 预训练在 Clotho 上实现。
- 该方法与现有图像-文本模型(如 CLIP)具有强互补性,且挖掘得到的数据在多样性与对齐性方面优于基于自动语音识别(ASR)的监督信号。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。