[论文解读] Vision-and-Language Pretrained Models: A Survey
本综述全面概述了视觉-语言预训练模型(VLPMs),详细介绍了其架构、输入编码方法、预训练与微调策略以及下游任务。它强调了多模态Transformer在学习联合视觉-语言表征中的作用,并指出了在跨模态对齐、多任务预训练和训练评估方面的主要挑战与未来方向,以提升模型效率与性能。
Pretrained models have produced great success in both Computer Vision (CV) and Natural Language Processing (NLP). This progress leads to learning joint representations of vision and language pretraining by feeding visual and linguistic contents into a multi-layer transformer, Visual-Language Pretrained Models (VLPMs). In this paper, we present an overview of the major advances achieved in VLPMs for producing joint representations of vision and language. As the preliminaries, we briefly describe the general task definition and genetic architecture of VLPMs. We first discuss the language and vision data encoding methods and then present the mainstream VLPM structure as the core content. We further summarise several essential pretraining and fine-tuning strategies. Finally, we highlight three future directions for both CV and NLP researchers to provide insightful guidance.
研究动机与目标
- 为计算机视觉(CV)和自然语言处理(NLP)领域的研究人员提供视觉-语言预训练模型(VLPMs)的系统性与全面性综述。
- 识别并分析VLPMs的关键组件,包括输入编码、交互建模和预训练策略。
- 总结主流VLPM架构及其在多样化视觉-语言任务中的性能表现。
- 突出当前开放性挑战,并提出在跨模态对齐、多任务预训练和训练评估方面的未来研究方向。
提出的方法
- 本文采用通用的四组件架构对主要VLPMs进行综述:视觉/语言原始输入、模态特定的表征学习、通过Transformer中的多头自注意力实现视觉-语言交互,以及输出联合跨模态表征。
- 分析使用BERT风格输入表征的语言编码方法,包括标记嵌入、位置嵌入和段落嵌入,涵盖模态特定与早期融合策略(例如在输入或表征层面的V2L)。
- 研究基于区域的视觉编码方法(如RoI特征),以及其与文本嵌入在Transformer编码器中的整合方式。
- 回顾预训练目标,如掩码语言建模、对比学习和掩码图像建模,这些目标应用于成对的图文数据。
- 评估在多样化下游任务中的微调策略,包括视觉问答(VQA)、图像字幕生成、视觉定位和视觉-语言导航。
- 提出未来研究方向,重点关注改进跨模态对齐、多阶段与多任务预训练,以及训练时间评估指标。
实验结果
研究问题
- RQ1视觉-语言预训练模型如何利用多模态Transformer学习图像与文本的联合表征?
- RQ2当前最先进的VLPMs中占主导地位的架构与输入编码策略是什么?
- RQ3预训练目标与微调策略如何影响视觉-语言任务中的下游性能?
- RQ4在跨模态对齐方面存在哪些关键挑战,又该如何应对?
- RQ5哪些未来方向可提升VLPMs的效率、泛化能力与评估水平?
主要发现
- 基于BERT风格Transformer架构并采用多头自注意力机制的VLPMs,能有效建模视觉与语言表征之间的跨模态交互。
- 将视觉特征早期融合进语言输入(例如通过对象标签)可提升视觉-语言任务中的对齐效果与性能表现。
- 在领域内数据集上进行预训练可显著提升下游任务性能,即使数据量较小,尤其在开放词汇与生成类任务中效果更明显。
- 多任务预训练策略(如12-in-1)通过模态内与模态间任务的协同作用实现性能增益,但最优任务分组与排序仍为开放性挑战。
- 训练时间评估指标(如困惑度)可用于早期检测模型缺陷,从而减少下游计算资源浪费。
- 在多样化、大规模成对图文数据上进行预训练的模型,在各类视觉-语言基准测试中均展现出强大的零样本与微调性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。