Skip to main content
QUICK REVIEW

[论文解读] VLP: A Survey on Vision-Language Pre-training

Feilong Chen, Duzhen Zhang|arXiv (Cornell University)|Feb 18, 2022
Multimodal Machine Learning Applications参考文献 151被引用 4
一句话总结

本综述全面概述了视觉-语言预训练(VLP),涵盖特征提取、模型架构、预训练目标、数据集以及下游任务。它系统性地回顾了最先进的VLP模型,并识别出新兴前沿,如提示微调、模型压缩、域外预训练,以及扩散模型和几何深度学习等新型架构。

ABSTRACT

In the past few years, the emergence of pre-training models has brought uni-modal fields such as computer vision (CV) and natural language processing (NLP) to a new era. Substantial works have shown they are beneficial for downstream uni-modal tasks and avoid training a new model from scratch. So can such pre-trained models be applied to multi-modal tasks? Researchers have explored this problem and made significant progress. This paper surveys recent advances and new frontiers in vision-language pre-training (VLP), including image-text and video-text pre-training. To give readers a better overall grasp of VLP, we first review its recent advances from five aspects: feature extraction, model architecture, pre-training objectives, pre-training datasets, and downstream tasks. Then, we summarize the specific VLP models in detail. Finally, we discuss the new frontiers in VLP. To the best of our knowledge, this is the first survey focused on VLP. We hope that this survey can shed light on future research in the VLP field.

研究动机与目标

  • 为计算机视觉和自然语言处理领域的研究人员提供关于视觉-语言预训练(VLP)的系统性与全面性综述。
  • 识别并分析VLP的关键组成部分,包括特征提取、模型架构、预训练目标、数据集以及下游任务。
  • 总结最先进的VLP模型,并突出其在架构与目标设计上的创新。
  • 探索VLP中的新兴前沿,如提示微调、模型压缩、域外预训练以及新型架构。
  • 通过整合当前领域的研究现状并指出开放性挑战,为未来研究提供基础参考。

提出的方法

  • 根据特征提取技术对VLP模型进行分类,包括基于目标检测的区域特征和CLIP风格的图像编码器。
  • 将模型架构划分为单流与双流,以及仅编码器与编码器-解码器配置。
  • 回顾四种主要的预训练目标类型:完型任务、匹配任务、时序任务,以及掩码语言建模等专用目标。
  • 整理并分析主要的预训练数据集,如COCO、Conceptual Captions和MS-COCO,强调其规模与模态覆盖范围。
  • 研究下游任务,包括图像字幕生成、视觉问答和视频-语言理解,详细说明其评估目标。
  • 探索提示微调、知识蒸馏和模型量化等新兴技术,以提升效率与泛化能力。

实验结果

研究问题

  • RQ1现代视觉-语言预训练模型的关键组件与设计选择是什么?
  • RQ2不同的预训练目标如何引导视觉与语言模态之间的跨模态对齐学习?
  • RQ3最具影响力的VLP模型有哪些?它们在架构或目标设计上引入了哪些创新?
  • RQ4VLP中的主要挑战与开放研究方向是什么,特别是在效率、泛化能力与认知整合方面?
  • RQ5提示微调与知识注入等新兴技术如何提升VLP模型的性能与适应性?

主要发现

  • 这是首篇专注于视觉-语言预训练的全面综述,整合了特征提取、模型设计、目标函数、数据集以及下游任务方面的进展。
  • 基于目标检测的区域特征(如Faster R-CNN)和CLIP风格的对比学习在特征提取中占主导地位,后者尤其支持零样本泛化。
  • 仅编码器架构与编码器-解码器架构被广泛采用,双流模型在需要模态特定处理的任务中通常优于单流模型。
  • 掩码语言建模、对比学习与掩码区域建模等预训练目标对于学习跨模态对齐至关重要。
  • 近期模型如VATT和OPT展示了联合文本、图像与音频预训练的可行性,具备多层次掩码与生成能力。
  • 新兴前沿如提示微调、知识注入与模型压缩在提升VLP的效率、泛化能力与可扩展性方面展现出巨大潜力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。