[论文解读] MVPTR: Multi-Level Semantic Alignment for Vision-Language Pre-Training via Multi-Stage Learning
MVPTR 提出了一种两阶段视觉-语言预训练框架,通过显式建模视觉和语言模态中的对象级和短语级语义,增强了多层次语义对齐。通过引入掩码概念恢复和结构化短语定位任务,MVPTR 在图像-文本检索、视觉定位和 VQA 基准上实现了最先进性能,证明了层次化对齐在多模态表示学习中的有效性。
Previous vision-language pre-training models mainly construct multi-modal inputs with tokens and objects (pixels) followed by performing cross-modality interaction between them. We argue that the input of only tokens and object features limits high-level semantic alignment like phrase-to-region grounding. Meanwhile, multi-level alignments are inherently consistent and able to facilitate the representation learning synergistically. Therefore, in this paper, we propose to learn Multi-level semantic alignment for Vision-language Pre-TRaining (MVPTR). In MVPTR, we follow the nested structure of both modalities to introduce concepts as high-level semantics. To ease the learning from multi-modal multi-level inputs, our framework is split into two stages, the first stage focuses on intra-modality multi-level representation learning, the second enforces interactions across modalities via both coarse-grained and fine-grained semantic alignment tasks. In addition to the commonly used image-text matching and masked language model tasks, we introduce a masked concept recovering task in the first stage to enhance the concept representation learning, and two more tasks in the second stage to explicitly encourage multi-level alignments across modalities. Our code is available at https://github.com/Junction4Nako/mvp_pytorch.
研究动机与目标
- 为解决现有视觉-语言预训练模型仅关注标记到区域对齐的局限性,避免遗漏如短语到区域定位等更高级语义关联。
- 通过在两种模态中引入嵌套语义概念的结构化输入,实现词、短语和对象之间的协同学习。
- 通过两阶段训练范式将模态内表示学习与跨模态交互解耦,以改善跨模态对齐。
- 通过基于场景图衍生的概念和对象标签作为锚点,显式建模短语级语义,提升下游任务的表示质量。
提出的方法
- 提出两阶段训练框架:首先进行单模态学习,利用掩码概念恢复(MCR)学习视觉模态的多级表示,利用短语感知的标记生成学习语言模态的表示。
- 引入对象标签和来自场景图的短语级概念作为高层语义单元,连接标记与视觉区域。
- 在视觉和语言两端均采用掩码概念恢复(MCR)任务,以对齐对象标签与视觉区域,以及短语与相关标记。
- 在第二阶段引入粗粒度和细粒度对齐任务,以在多个语义层次上强制执行跨模态交互。
- 采用解耦注意力机制,分离模态内与跨模态注意力,防止单模态学习与跨模态交互之间的干扰。
- 引入基于加权短语定位(WPG)的短语级定位任务,显式建模短语与视觉区域之间的关系。
实验结果
研究问题
- RQ1显式建模多级语义(词、短语、对象)是否能超越标记到区域对齐,提升视觉-语言预训练性能?
- RQ2将单模态学习与跨模态学习阶段分离,对多级表示学习质量有何影响?
- RQ3引入掩码概念恢复和短语定位任务对下游视觉-语言基准性能有何影响?
- RQ4对象级和短语级语义在视觉-语言模型中作为更高级对齐的基础组件,其作用程度如何?
主要发现
- 消融实验证明,移除对象级概念会显著降低图像-文本匹配和短语定位性能,证实其在多级对齐中的基础性作用。
- 通过 WPG 和 MCR 显式建模短语级语义,分别使视觉定位和细粒度匹配性能提升 2.1% 和 1.8%,证明了结构化短语表示的优势。
- 两阶段框架通过减少注意力干扰,优于端到端模型,在 MSCOCO、Flickr30k、VQA 和 SNLI-VE 基准上均取得最先进结果。
- 可视化结果表明,模型能够学习将短语概念(如 'group-of-zebra')与对应视觉区域对齐,验证了短语级注意力机制的有效性。
- 模型在不同数据集上泛化能力良好,如 'two-man' 和 'young-boy' 等短语在 MSCOCO、Flickr30k 和 VQA 中频繁且一致地出现。
- 使用场景图衍生的概念可获得更鲁棒的短语表示,如定性注意力图所示,短语节点能正确关联到相关图像区域。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。