Skip to main content
QUICK REVIEW

[论文解读] VLMAE: Vision-Language Masked Autoencoder

Sunan He, Taian Guo|arXiv (Cornell University)|Aug 19, 2022
Multimodal Machine Learning Applications被引用 9
一句话总结

VLMAE 提出了一种视觉-语言掩码自编码器框架,通过采用像素级重建和掩码特征预测,缓解了视觉-语言预训练中的焦点偏差问题,实现了下游任务的最先进性能,且预训练速度最快提升20%。该方法采用非对称编码器-解码器架构,结合区域级和特征级掩码,增强了对图像的全面理解与多模态对齐能力。

ABSTRACT

Image and language modeling is of crucial importance for vision-language pre-training (VLP), which aims to learn multi-modal representations from large-scale paired image-text data. However, we observe that most existing VLP methods focus on modeling the interactions between image and text features while neglecting the information disparity between image and text, thus suffering from focal bias. To address this problem, we propose a vision-language masked autoencoder framework (VLMAE). VLMAE employs visual generative learning, facilitating the model to acquire fine-grained and unbiased features. Unlike the previous works, VLMAE pays attention to almost all critical patches in an image, providing more comprehensive understanding. Extensive experiments demonstrate that VLMAE achieves better performance in various vision-language downstream tasks, including visual question answering, image-text retrieval and visual grounding, even with up to 20% pre-training speedup.

研究动机与目标

  • 为解决视觉-语言预训练中的焦点偏差问题,即模型过度关注文本描述中的显著图像区域,而忽略其他关键物体。
  • 通过利用生成式预训练任务,促进全面的图像特征提取,从而改善多模态表征学习。
  • 通过高效的掩码与重建策略,在保持或提升性能的同时降低预训练成本。
  • 通过新型损失函数——区域掩码图像建模(RMIM)和图像特征重建(IFR),增强图像-文本对齐与模型表征能力。

提出的方法

  • VLMAE 采用非对称编码器-解码器架构,配备独立的视觉与语言单模态编码器,轻量级图像解码器用于像素重建,以及融合学习器用于多模态特征聚合。
  • 在预训练过程中对图像块施加高掩码比例(最高达50%),强制编码器从可见块中学习并重建缺失块,促进鲁棒且无偏的特征学习。
  • 引入区域掩码图像建模(RMIM),通过重建局部区域内的图像块来优化图像-文本对齐,提升跨模态一致性。
  • 图像特征重建(IFR)使模型能够基于可见块预测被掩码的视觉块特征,增强图像编码器的表征能力。
  • 将对比学习(ITC)与掩码语言建模(MLM)结合生成式目标,联合优化对齐与重建。
  • 掩码策略通过仅处理50%的图像块,显著降低计算成本,减少MACs与训练时间。

实验结果

研究问题

  • RQ1使用掩码图像重建的生成式预训练是否能减少视觉-语言模型中的焦点偏差?
  • RQ2与全局掩码相比,区域掩码在多模态学习中如何提升图像-文本对齐?
  • RQ3视觉块的特征级重建在多大程度上增强了模型的表征能力?
  • RQ4掩码自编码器框架是否能在降低预训练成本的同时实现视觉-语言任务的最先进性能?
  • RQ5高图像块掩码比例是否能提升视觉-语言表征学习中的泛化性与鲁棒性?

主要发现

  • VLMAE 在图像-文本检索任务(Flickr30k 上为98.2 TR、92.9 IR)和视觉问答任务中均达到最先进性能,优于 ALBEF 与 TCL。
  • 在50%掩码比例下,VLMAE 将预训练时间减少20%(6.2小时 vs. 7.7小时),MACs减少18%(49.6G vs. 60.5G),相比 ALBEF。
  • Grad-CAM 可视化显示,VLMAE 在视觉定位任务中关注整个相关图像区域,而 ALBEF 仅聚焦于显著物体。
  • 消融实验表明,加入 MIM、RMIM 与 IFR 损失可提升性能,其中 RMIM 对对齐性能的增益最为显著。
  • 注意力权重分析显示,VLMAE 在图像块间分布更均衡,减少对低注意力区域的忽略,从而最小化偏差。
  • 即使在75%的掩码比例下,模型仍保持强性能,尽管略有下降,表明对高掩码比例具有鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。