Skip to main content
QUICK REVIEW

[论文解读] E2E-VLP: End-to-End Vision-Language Pre-training Enhanced by Visual Learning

Haiyang Xu, Ming Yan|arXiv (Cornell University)|Jun 3, 2021
Multimodal Machine Learning Applications参考文献 37被引用 8
一句话总结

E2E-VLP 提出首个端到端视觉-语言预训练模型,通过统一的 Transformer 编码器-解码器架构,直接从图像像素联合学习视觉表征与跨模态对齐。通过将目标检测和图像字幕生成作为预训练任务,其在下游视觉-语言任务中实现最先进性能,且推理速度优于两阶段方法。

ABSTRACT

Vision-language pre-training (VLP) on large-scale image-text pairs has achieved huge success for the cross-modal downstream tasks. The most existing pre-training methods mainly adopt a two-step training procedure, which firstly employs a pre-trained object detector to extract region-based visual features, then concatenates the image representation and text embedding as the input of Transformer to train. However, these methods face problems of using task-specific visual representation of the specific object detector for generic cross-modal understanding, and the computation inefficiency of two-stage pipeline. In this paper, we propose the first end-to-end vision-language pre-trained model for both V+L understanding and generation, namely E2E-VLP, where we build a unified Transformer framework to jointly learn visual representation, and semantic alignments between image and text. We incorporate the tasks of object detection and image captioning into pre-training with a unified Transformer encoder-decoder architecture for enhancing visual learning. An extensive set of experiments have been conducted on well-established vision-language downstream tasks to demonstrate the effectiveness of this novel VLP paradigm.

研究动机与目标

  • 解决两阶段视觉-语言预训练的局限性,后者依赖缓存的目标特征,存在误差传播与效率低下问题。
  • 开发一种端到端框架,直接从原始图像像素联合学习视觉表征与跨模态对齐。
  • 通过在统一的 Transformer 架构中引入细粒度预训练任务(如目标检测与图像字幕生成),增强视觉学习能力。
  • 通过单一模型架构,统一支持视觉-语言理解与生成任务。

提出的方法

  • E2E-VLP 使用统一的 Transformer 编码器-解码器架构,直接从图像像素联合学习视觉特征与跨模态表征。
  • 通过二分图匹配将目标检测建模为集合预测任务,与跨模态编码器端到端联合训练。
  • 图像字幕建模为自回归语言建模目标,其中编码器处理图像,解码器生成文本。
  • 在预训练过程中,联合优化掩码语言建模、图文匹配、目标检测与图像字幕任务。
  • 视觉特征基于网格表示而非区域提议提取,实现更快、更高效的推理。
  • 该框架支持在下游任务中进行仅编码器(用于理解)与编码器-解码器(用于生成)的微调。

实验结果

研究问题

  • RQ1端到端视觉-语言预训练(直接输入像素)是否能在跨模态理解与生成任务中超越两阶段方法?
  • RQ2将目标检测与图像字幕作为预训练任务,如何提升视觉表征学习能力?
  • RQ3使用网格特征而非基于区域的特征,对推理效率与性能有何影响?
  • RQ4在检测与字幕任务上联合预训练,是否能带来更好的跨模态融合与对齐效果?
  • RQ5输入图像尺寸如何影响端到端 VLP 中推理速度与模型准确率之间的权衡?

主要发现

  • E2E-VLP 在多个视觉-语言基准测试中达到最先进或具有竞争力的性能,包括 VQA、NLVR2 与图像字幕任务。
  • 在完整输入尺寸(800×1333)下,VQA 准确率达 73.25%,NLVR2 准确率达 77.25%;使用 448×448 输入时,推理速度提升 5 倍,性能仅下降 2%-3%。
  • 在 MSCOCO 上的目标检测性能达到 41.9 mAP,优于原始 DETR(40.6 mAP),证明其具备强大的视觉特征学习能力。
  • 使用更深的 ResNet-152 主干网络带来的性能增益,大于增加 Transformer 编码器层数的效果,凸显视觉特征质量的重要性。
  • 模型展现出强大的泛化能力,仅通过单一统一架构即可在视觉-语言理解与生成任务中均取得良好表现。
  • 将输入图像下采样至 448×448 可使推理时间减少 5 倍,且准确率损失极小,充分证明了一阶段设计的高效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。