Skip to main content
QUICK REVIEW

[论文解读] COBRA: Contrastive Bi-Modal Representation Algorithm

Vishaal Udandarao, Abhishek Maiti|arXiv (Cornell University)|May 7, 2020
Multimodal Machine Learning Applications参考文献 53被引用 4
一句话总结

COBRA 提出了一种对比式双模态表征学习框架,通过对比预测编码(CPC)和噪声对比估计(NCE)的原则,联合训练视觉与语言编码器,以同时保留类内和类间关系。通过对比学习缩小模态差距,COBRA 在七个跨模态基准数据集上实现了最先进性能,涵盖四类不同的下游任务,展示了其在鲁棒性与任务无关性方面联合嵌入空间的优越性。

ABSTRACT

There are a wide range of applications that involve multi-modal data, such as cross-modal retrieval, visual question-answering, and image captioning. Such applications are primarily dependent on aligned distributions of the different constituent modalities. Existing approaches generate latent embeddings for each modality in a joint fashion by representing them in a common manifold. However these joint embedding spaces fail to sufficiently reduce the modality gap, which affects the performance in downstream tasks. We hypothesize that these embeddings retain the intra-class relationships but are unable to preserve the inter-class dynamics. In this paper, we present a novel framework COBRA that aims to train two modalities (image and text) in a joint fashion inspired by the Contrastive Predictive Coding (CPC) and Noise Contrastive Estimation (NCE) paradigms which preserve both inter and intra-class relationships. We empirically show that this framework reduces the modality gap significantly and generates a robust and task agnostic joint-embedding space. We outperform existing work on four diverse downstream tasks spanning across seven benchmark cross-modal datasets.

研究动机与目标

  • 解决多模态表征学习中持续存在的模态差距问题,该问题限制了跨模态任务的性能。
  • 通过保留图像与文本模态之间的类内与类间关系,改进联合嵌入空间。
  • 开发一种任务无关的框架,使其在视觉问答和图像字幕等多样化下游应用中具有良好泛化能力。
  • 通过利用自监督对比学习减少对监督信号的依赖,实现联合表征学习。

提出的方法

  • COBRA 采用受对比预测编码(CPC)启发的对比学习目标,其中正样本对由同一图像-文本样本的增强视图构成。
  • 利用噪声对比估计(NCE)在训练过程中区分正样本对与负样本,促使模型学习更具判别性的表征。
  • 该框架在共享潜在空间中联合优化图像与文本编码器,确保模态间对齐,且在预训练阶段无需成对标注。
  • 采用实例级对比损失并结合负样本挖掘策略,以增强不同样本对之间的判别能力。
  • 模型通过数据增强(如图像的随机裁剪、文本的掩码)生成对比学习所需的正视图。
  • 最终的联合嵌入空间通过反向传播端到端优化,无需在下游任务上进行微调。

实验结果

研究问题

  • RQ1自监督对比学习框架能否有效缩小视觉与语言表征之间的模态差距?
  • RQ2同时保留类内与类间关系是否能提升下游跨模态任务的泛化能力?
  • RQ3任务无关的表征学习方法是否能在多样化基准上超越现有监督与弱监督基线方法?
  • RQ4CPC与NCE的结合相较于标准对比学习或自编码方法,如何提升表征质量?

主要发现

  • COBRA 在涵盖四类下游任务(包括跨模态检索、视觉问答和图像字幕)的七个基准数据集上达到最先进性能。
  • 该模型在所有评估数据集上均优于现有方法,mAP与准确率指标均有显著提升。
  • 消融实验证实CPC与NCE组件均不可或缺,任一移除均导致性能明显下降。
  • COBRA 展现出强大的零样本泛化能力,在无需微调的下游任务中取得具有竞争力的结果。
  • 学习到的联合嵌入空间在图像与文本表征之间表现出更优的对齐,表现为类间混淆降低、类内紧凑性提高。
  • 该框架在多样化数据分布与模态下表现稳健,证实其任务无关性与可扩展性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。