[论文解读] X$^2$-VLM: All-In-One Pre-trained Model For Vision-Language Tasks
X$^2$-VLM 提出了一种统一的、端到端的视觉-语言预训练框架,通过灵活的模块化 Transformer 架构学习跨物体、区域和完整图像的多粒度视觉-文本对齐。通过联合优化图像-文本和视频-文本对齐对与定位任务,该方法在图像-文本和视频-文本基准上均实现了最先进性能,并通过简单的文本编码器替换实现了多语言和分布外任务的零样本迁移。
Vision language pre-training aims to learn alignments between vision and language from a large amount of data. Most existing methods only learn image-text alignments. Some others utilize pre-trained object detectors to leverage vision language alignments at the object level. In this paper, we propose to learn multi-grained vision language alignments by a unified pre-training framework that learns multi-grained aligning and multi-grained localization simultaneously. Based on it, we present X$^2$-VLM, an all-in-one model with a flexible modular architecture, in which we further unify image-text pre-training and video-text pre-training in one model. X$^2$-VLM is able to learn unlimited visual concepts associated with diverse text descriptions. Experiment results show that X$^2$-VLM performs the best on base and large scale for both image-text and video-text tasks, making a good trade-off between performance and model scale. Moreover, we show that the modular design of X$^2$-VLM results in high transferability for it to be utilized in any language or domain. For example, by simply replacing the text encoder with XLM-R, X$^2$-VLM outperforms state-of-the-art multilingual multi-modal pre-trained models without any multilingual pre-training. The code and pre-trained models are available at https://github.com/zengyan-97/X2-VLM.
研究动机与目标
- 为解决现有视觉-语言模型仅关注粗粒度或物体级对齐的局限性,通过学习跨物体、区域和完整图像的多粒度视觉-文本对齐。
- 在单一模型架构中统一图像-文本和视频-文本预训练,以实现更广泛的多模态理解。
- 通过模块化设计,实现无需额外预训练即可将模型零样本迁移至多语言或分布外任务。
- 在大规模、噪声较多的图像-文本和视频-文本数据上有效扩展多粒度预训练。
- 证明学习细粒度对齐可提升在弱相关图像-文本对和复杂下游任务上的性能。
提出的方法
- X$^2$-VLM 采用基于三模块 Transformer 的架构:视觉编码器、文本编码器和跨注意力融合模块。
- 视觉编码器通过视觉 Transformer 处理图像,提取将多粒度视觉概念(如物体、区域或完整图像)统一表示的图像块特征。
- 通过联合优化多粒度对齐(将视觉特征与对应文本特征对齐)和多粒度定位(根据文本描述预测视觉概念的边界框),实现多粒度对齐。
- 模型在三种数据类型上进行预训练:物体标签、区域标注和完整图像标题,使其能够学习与多样化文本描述相关联的视觉概念。
- 通过采样视频帧、使用相同的视觉编码器编码,并在时间维度上对图像块特征进行平均,将视频-文本预训练与图像-文本预训练统一。
- 模块化设计允许通过替换文本编码器(如 XLM-R)实现即插即用的零样本适应,以支持多语言或领域特定任务。
实验结果
研究问题
- RQ1是否能够在一个统一的预训练框架中,无需依赖目标检测器,有效学习跨物体、区域和完整图像的多粒度视觉-语言对齐?
- RQ2对多粒度对齐和定位进行联合优化,如何提升下游视觉-语言任务的性能?
- RQ3单个预训练模型在共享编码器参数的前提下,能在多大程度上泛化至图像-文本和视频-文本任务?
- RQ4X$^2$-VLM 的模块化架构是否能够在无需进一步预训练的情况下,实现对多语言或分布外任务的零样本迁移?
- RQ5在检索、定位和开放词汇检测任务中,物体级和区域级监督对性能的相对贡献如何?
主要发现
- X$^2$-VLM 在基础和大规模图像-文本及视频-文本基准上均实现了最先进性能,在检索、VQA 和视觉定位任务中优于现有方法。
- 消融实验表明,若移除多粒度对齐或定位损失,性能均出现显著下降,证实两个组件均至关重要。
- 结合物体和区域数据可在所有任务中取得最佳性能,其中物体数据对图像检索至关重要,区域数据对视觉定位至关重要。
- 通过将文本编码器替换为 XLM-R,X$^2$-VLM 实现了强大的零样本多语言迁移能力,其性能优于未经过多语言预训练的专用多语言预训练模型。
- 定性结果表明,X$^2$-VLM 能够准确地在开放域图像中定位细粒度视觉概念,如特定品牌、角色或部分遮挡的物体。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。