Skip to main content
QUICK REVIEW

[论文解读] VLMixer: Unpaired Vision-Language Pre-training via Cross-Modal CutMix

Teng Wang, Wenhao Jiang|arXiv (Cornell University)|Jun 17, 2022
Multimodal Machine Learning Applications被引用 12
一句话总结

VLMixer 提出了一种新颖的无配对视觉-语言预训练方法,通过跨模态 CutMix(CMC)生成多模态句子,将文本中的定位词替换为语义对齐的图像块,从而在无需配对数据的情况下实现隐式跨模态对齐。通过将 CMC 与对比学习结合,VLMixer 在五个下游视觉-语言任务上实现了最先进性能,优于先前的无配对方法。

ABSTRACT

Existing vision-language pre-training (VLP) methods primarily rely on paired image-text datasets, which are either annotated by enormous human labors, or crawled from the internet followed by elaborate data cleaning techniques. To reduce the dependency on well-aligned image-text pairs, it is promising to directly leverage the large-scale text-only and image-only corpora. This paper proposes a data augmentation method, namely cross-modal CutMix (CMC), for implicit cross-modal alignment learning in unpaired VLP. Specifically, CMC transforms natural sentences from the textual view into a multi-modal view, where visually-grounded words in a sentence are randomly replaced by diverse image patches with similar semantics. There are several appealing proprieties of the proposed CMC. First, it enhances the data diversity while keeping the semantic meaning intact for tackling problems where the aligned data are scarce; Second, by attaching cross-modal noise on uni-modal data, it guides models to learn token-level interactions across modalities for better denoising. Furthermore, we present a new unpaired VLP method, dubbed as VLMixer, that integrates CMC with contrastive learning to pull together the uni-modal and multi-modal views for better instance-level alignments among different modalities. Extensive experiments on five downstream tasks show that VLMixer could surpass previous state-of-the-art unpaired VLP methods.

研究动机与目标

  • 减少视觉-语言预训练中对昂贵且人工标注的图像-文本配对数据的依赖。
  • 仅使用独立的图像和文本语料库,在无配对设置下实现有效的跨模态对齐。
  • 通过在不改变语义的前提下向自然语言句子中注入视觉标记,提升数据多样性和模型泛化能力。
  • 通过数据增强实现隐式对齐,学习细粒度的、标记级别的跨模态交互。
  • 在不依赖图像标签或显式对齐监督的情况下,实现无配对视觉-语言预训练的最先进性能。

提出的方法

  • 跨模态 CutMix(CMC)通过将文本中视觉定位的词语替换为从预先构建的视觉块图库中提取的语义相似图像块,构建多模态句子。
  • 视觉块图库通过概念检测器从仅图像的数据集中提取高质量、多样化的图像块,确保与文本概念的语义一致性。
  • 在原始文本句子与其经 CMC 变换的多模态版本之间应用对比学习目标,以鼓励模态间的实例级对齐。
  • 该方法使用共享编码器将单模态和多模态视图映射到联合嵌入空间,通过对比损失实现对齐。
  • 引入 K-shot CMC 和上下文感知采样策略,以提升预训练过程中图像块替换的质量与平衡性。
  • 模型在大规模无配对图像和文本数据集(如 COCO)上进行预训练,并在下游任务上微调,全程无需任何配对数据。

实验结果

研究问题

  • RQ1通过 CutMix 实现的跨模态数据增强是否能提升无配对视觉-语言预训练中的跨模态对齐效果?
  • RQ2在自然语言句子中注入视觉标记是否能在保持语义不变的同时增强模型泛化能力?
  • RQ3在无配对监督下,单模态与多模态视图之间的对比学习是否能有效对齐模态?
  • RQ4文本语料与图像语料之间共享的视觉概念数量如何影响下游性能?
  • RQ5采样策略(如 K-shot、上下文感知)对多模态句子构建质量有何影响?

主要发现

  • VLMixer 在五个下游视觉-语言任务上实现了最先进性能,包括 VQA 和 NLVR2,优于先前的无配对预训练方法。
  • 在 NLVR2 基准上,VLMixer 在测试集上达到 73.08% 的准确率,显著超越此前最先进方法。
  • 消融实验表明,K-shot CMC 和上下文感知采样均能提升性能,且更大的 K 值因实现更均衡的标记混合而表现更优。
  • 图库中共享概念的数量与性能正相关,峰值出现在 1200 个概念左右,之后因长尾类别误识别而略有下降。
  • 与仅文本的数据增强(如裁剪、删除词语)相比,单模态与多模态视图之间的对比学习表现更优,证明了跨模态监督的有效性。
  • 模型性能对数据增强设计具有鲁棒性,跨模态对比学习在多个任务上均持续提升结果。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。