Skip to main content
QUICK REVIEW

[论文解读] MAP: Multimodal Uncertainty-Aware Vision-Language Pre-training Model

Yatai Ji, Junjie Wang|arXiv (Cornell University)|Oct 11, 2022
Multimodal Machine Learning Applications被引用 4
一句话总结

本文提出MAP,一种多模态视觉-语言自监督预训练模型,通过概率分布编码器(PDE)将模态特征表示为高斯分布以建模不确定性。通过整合不确定性感知的预训练任务——D-VLC、D-MLM和D-ITM,MAP在图像-文本检索、VQA和视觉推理等下游任务中取得最先进性能,同时通过分布采样实现多样化、基于不确定性的预测。

ABSTRACT

Multimodal semantic understanding often has to deal with uncertainty, which means the obtained messages tend to refer to multiple targets. Such uncertainty is problematic for our interpretation, including inter- and intra-modal uncertainty. Little effort has studied the modeling of this uncertainty, particularly in pre-training on unlabeled datasets and fine-tuning in task-specific downstream datasets. In this paper, we project the representations of all modalities as probabilistic distributions via a Probability Distribution Encoder (PDE) by utilizing sequence-level interactions. Compared to the existing deterministic methods, such uncertainty modeling can convey richer multimodal semantic information and more complex relationships. Furthermore, we integrate uncertainty modeling with popular pre-training frameworks and propose suitable pre-training tasks: Distribution-based Vision-Language Contrastive learning (D-VLC), Distribution-based Masked Language Modeling (D-MLM), and Distribution-based Image-Text Matching (D-ITM). The fine-tuned models are applied to challenging downstream tasks, including image-text retrieval, visual question answering, visual reasoning, and visual entailment, and achieve state-of-the-art results.

研究动机与目标

  • 为解决多模态理解中的语义不确定性挑战,特别是视觉-语言任务中的模态间与模态内模糊性。
  • 将多模态表示中的不确定性建模为概率分布而非确定性点,以捕捉更丰富的语义关系。
  • 开发新型预训练任务,利用分布表示对大规模无标签数据进行学习。
  • 将不确定性建模整合进统一的端到端预训练框架,以提升下游任务性能。
  • 通过从学习到的分布中采样,实现在VQA和图像字幕生成等任务中多样化且合理的预测。

提出的方法

  • 概率分布编码器(PDE)通过标记与图像块之间的注意力交互,将视觉和语言模态的序列级表示转换为高斯分布。
  • 每个模态的表示被参数化为均值和方差向量,形成多元高斯分布以编码不确定性。
  • 引入三项新型预训练任务:基于分布的视觉-语言对比学习(D-VLC)、基于分布的掩码语言建模(D-MLM)和基于分布的图像-文本匹配(D-ITM)。
  • D-VLC通过跨模态对齐整体分布表示,实现粗粒度的跨模态理解。
  • D-MLM和D-ITM分别在标记级别和整体级别上利用分布预测,细化对齐效果。
  • 模型在下游任务(如VQA、图像检索和视觉蕴涵)上进行端到端微调。

实验结果

研究问题

  • RQ1将多模态表示建模为概率分布是否能提升视觉-语言任务中的语义理解?
  • RQ2基于分布表示的不确定性感知预训练对视觉-语言基准的下游性能有何影响?
  • RQ3分布表示在多大程度上能实现在VQA和字幕生成等任务中的多样化且合理的预测?
  • RQ4哪些预训练组件(D-VLC、D-MLM、D-ITM)对模型性能贡献最大?
  • RQ5不确定性建模的整合是否能缓解模糊视觉与语言语境中的歧义?

主要发现

  • MAP在图像-文本检索、VQA2.0、NLVR2和SNLI-VE任务上均达到最先进性能,证明了不确定性感知预训练的有效性。
  • D-MLM预训练任务对性能贡献最大,未使用该任务的模型在所有策略下表现最差。
  • 预训练使深层模型(如8层)能更好地泛化,克服了随机初始化模型中常见的性能瓶颈。
  • 可视化显示,分布表示将语义相似的图像和字幕聚集在一起,重叠的椭圆表明共享语义。
  • 从分布表示中采样可生成多样化且合理的答案(例如,同一张图像可生成‘field’、‘park’、‘grass’等不同答案),而确定性模型仅产生单一答案。
  • PDE模块使模型能够表达复杂关系与不确定性,从而在模糊场景中提升鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。