[论文解读] Probing Inter-modality: Visual Parsing with Self-Attention for Vision-Language Pre-training
本文提出了一种完全基于Transformer的视觉嵌入方法,用于视觉语言预训练,通过自注意力机制(视觉解析)取代CNN,以更好地捕捉长距离视觉关系。该方法引入了掩码特征回归(MFR)以优化跨模态学习,并提出跨模态流(IMF)来衡量跨模态交互,实现了在多个视觉语言任务上的最先进性能,同时展现出更优的跨模态对齐能力。
Vision-Language Pre-training (VLP) aims to learn multi-modal representations from image-text pairs and serves for downstream vision-language tasks in a fine-tuning fashion. The dominant VLP models adopt a CNN-Transformer architecture, which embeds images with a CNN, and then aligns images and text with a Transformer. Visual relationship between visual contents plays an important role in image understanding and is the basic for inter-modal alignment learning. However, CNNs have limitations in visual relation learning due to local receptive field's weakness in modeling long-range dependencies. Thus the two objectives of learning visual relation and inter-modal alignment are encapsulated in the same Transformer network. Such design might restrict the inter-modal alignment learning in the Transformer by ignoring the specialized characteristic of each objective. To tackle this, we propose a fully Transformer visual embedding for VLP to better learn visual relation and further promote inter-modal alignment. Specifically, we propose a metric named Inter-Modality Flow (IMF) to measure the interaction between vision and language modalities (i.e., inter-modality). We also design a novel masking optimization mechanism named Masked Feature Regression (MFR) in Transformer to further promote the inter-modality learning. To the best of our knowledge, this is the first study to explore the benefit of Transformer for visual feature learning in VLP. We verify our method on a wide range of vision-language tasks, including Image-Text Retrieval, Visual Question Answering (VQA), Visual Entailment and Visual Reasoning. Our approach not only outperforms the state-of-the-art VLP performance, but also shows benefits on the IMF metric.
研究动机与目标
- 为解决CNN在建模长距离视觉关系方面的局限性,该局限性阻碍了视觉语言预训练中的有效跨模态对齐。
- 探索在视觉语言模型中使用自注意力机制进行视觉特征学习的优势,超越基于CNN的视觉编码器。
- 设计一种新颖的掩码机制(MFR),利用视觉解析中的依赖关系,促进语言引导的视觉表征学习。
- 提出跨模态流(IMF)作为度量指标,用于量化和探测训练过程中视觉与语言模态之间的信息流动。
- 在多样化的视觉语言任务上评估所提方法的有效性,并通过消融研究和探针分析,深入分析跨模态融合动态。
提出的方法
- 用完全基于Transformer的视觉嵌入网络替代基于CNN的视觉编码器,通过自注意力机制实现全局、长距离视觉关系建模。
- 提出视觉解析作为学习视觉特征中token间依赖关系的方法,其中每个视觉token通过学习到的注意力权重关注所有其他token。
- 设计掩码特征回归(MFR)作为新颖的掩码优化机制,通过掩码高依赖度的视觉token,迫使多模态Transformer更多地依赖语言信号。
- 提出跨模态流(IMF)作为逐层度量指标,用于量化视觉与语言模态之间的信息流动,计算方式为Transformer各层中从输入到输出的注意力流动。
- 使用标准VLP目标(MLM、MFR)进行端到端训练,同时将IMF用作诊断工具,分析模态交互动态。
- 在每层对视觉和语言特征进行k-means聚类,并计算归一化互信息(NMI),以评估数据分布融合情况,为IMF提供互补分析。
实验结果
研究问题
- RQ1完全基于Transformer的视觉编码器是否能在视觉关系学习和提升视觉语言预训练中的跨模态对齐方面,优于基于CNN的编码器?
- RQ2通过自注意力机制实现的视觉解析,与CNN中的局部感受野相比,如何增强对长距离视觉依赖关系的建模能力?
- RQ3所提出的MFR掩码机制在多大程度上通过聚焦高依赖度视觉token,改善了跨模态注意力?
- RQ4跨模态流(IMF)度量指标与下游任务性能的相关性如何,能否真实反映模态间的交互?
- RQ5通过NMI分析探针数据分布融合,以及IMF,能对不同VLP架构中模态交互的程度与动态得出哪些见解?
主要发现
- 所提出的完全基于Transformer的视觉嵌入在多个基准测试中均优于当前最先进(SOTA)的VLP模型,涵盖图像-文本检索、VQA、视觉蕴涵和视觉推理等任务。
- 该模型在所有Transformer层中均表现出更高的跨模态流(IMF)分数,表明视觉与语言模态之间的信息流动更强且更持续。
- MFR通过掩码高注意力依赖度的视觉token,显著提升了性能,迫使模型在对齐过程中更多依赖语言上下文。
- IMF度量指标与下游任务性能呈正相关,验证了其作为跨模态学习诊断工具的有效性。
- 消融研究证实,视觉解析和MFR均为关键组件:前者提升了视觉关系建模能力,后者增强了跨模态注意力。
- NMI分析显示,采用端到端视觉主干网络的模型(SOHO和本模型)的NMI分数低于UNITER,表明模态分离程度更低,融合更强;但IMF能更准确地衡量模态交互。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。