Skip to main content
QUICK REVIEW

[논문 리뷰] E2E-VLP: End-to-End Vision-Language Pre-training Enhanced by Visual Learning

Haiyang Xu, Ming Yan|arXiv (Cornell University)|2021. 06. 03.
Multimodal Machine Learning Applications참고 문헌 37인용 수 8
한 줄 요약

E2E-VLP는 원시 이미지 픽셀에서 직접 시각적 표현과 다중모달 정렬을 동시에 학습하는 유일한 엔드 투 엔드 비전-언어 사전학습 모델을 제안한다. 통합 Transformer 인코더-디코더 아키텍처를 사용하며, 객체 검출과 이미지 캡션 생성을 사전학습 작업으로 통합함으로써, 이중 단계 방법보다 빠른 추론 속도를 기록하면서도 다운스트림 비전-언어 작업에서 최고 성능을 달성한다.

ABSTRACT

Vision-language pre-training (VLP) on large-scale image-text pairs has achieved huge success for the cross-modal downstream tasks. The most existing pre-training methods mainly adopt a two-step training procedure, which firstly employs a pre-trained object detector to extract region-based visual features, then concatenates the image representation and text embedding as the input of Transformer to train. However, these methods face problems of using task-specific visual representation of the specific object detector for generic cross-modal understanding, and the computation inefficiency of two-stage pipeline. In this paper, we propose the first end-to-end vision-language pre-trained model for both V+L understanding and generation, namely E2E-VLP, where we build a unified Transformer framework to jointly learn visual representation, and semantic alignments between image and text. We incorporate the tasks of object detection and image captioning into pre-training with a unified Transformer encoder-decoder architecture for enhancing visual learning. An extensive set of experiments have been conducted on well-established vision-language downstream tasks to demonstrate the effectiveness of this novel VLP paradigm.

연구 동기 및 목표

  • 이중 단계 비전-언어 사전학습의 한계를 해결하기 위해 캐시된 객체 특징에 의존하고 오류 전파 및 비효율성 문제를 겪는 기존 방법의 문제점을 해결한다.
  • 원시 이미지 픽셀에서 직접 시각적 표현과 다중모달 정렬을 동시에 학습하는 엔드 투 엔드 프레임워크를 개발한다.
  • 통합 Transformer 아키텍처 내에서 객체 검출 및 이미지 캡션과 같은 세분화된 사전학습 작업을 통해 시각적 학습을 향상시킨다.
  • 단일 모델 아키텍처를 통해 비전-언어 이해 및 생성 작업을 통합적으로 처리할 수 있도록 한다.

제안 방법

  • E2E-VLP는 통합 Transformer 인코더-디코더 아키텍처를 사용하여 원시 이미지 픽셀에서 직접 시각적 특징과 다중모달 표현을 동시에 학습한다.
  • 이중 매칭을 사용한 집합 예측 작업으로 객체 검출을 모델링하며, 다중모달 인코더와 함께 엔드 투 엔드로 훈련된다.
  • 이미지 캡션은 자동회귀 언어 모델링 목표로 모델링되며, 인코더는 이미지를 처리하고 디코더는 텍스트를 생성한다.
  • 사전학습 중에 마스크된 언어 모델링, 이미지-텍스트 매칭, 객체 검출, 이미지 캡션을 동시에 최적화한다.
  • 시각적 특징은 영역 제안이 아닌 격자 기반 표현에서 유도되며, 이는 더 빠르고 효율적인 추론을 가능하게 한다.
  • 프레임워크는 다운스트림 작업에서 이해용(인코더 전용) 및 생성용(인코더-디코더)의 양식으로 파인튜닝을 지원한다.

실험 결과

연구 질문

  • RQ1직접 픽셀 입력을 사용하는 엔드 투 엔드 비전-언어 사전학습이 이중 단계 방법보다 다중모달 이해 및 생성 작업에서 성능을 뛰어넘을 수 있는가?
  • RQ2객체 검출 및 이미지 캡션을 사전학습 작업으로 통합함으로써 시각적 표현 학습은 어떻게 향상되는가?
  • RQ3영역 기반 특징 대비 격자 기반 특징을 사용할 경우 추론 효율성과 성능에 어떤 영향을 미치는가?
  • RQ4검출 및 캡션에 대한 동시 사전학습이 더 나은 다중모달 융합과 정렬을 이끌어내는가?
  • RQ5엔드 투 엔드 VLP에서 입력 이미지 크기가 추론 속도와 모델 정확도 사이의 트레이드오프에 어떤 영향을 미치는가?

주요 결과

  • E2E-VLP는 VQA, NLVR2, 이미지 캡션 등 다양한 비전-언어 벤치마크에서 최고 수준 또는 경쟁력 있는 성능을 기록한다.
  • 전체 입력 크기(800×1333)에서 VQA 정확도는 73.25%, NLVR2 정확도는 77.25%를 달성했으며, 448×448 입력을 사용할 경우 추론 속도가 5배 향상되고 정확도 손실는 2%-3%에 불과하다.
  • MSCOCO에서의 객체 검출 성능은 41.9 mAP를 기록하여 원본 DETR(40.6 mAP)를 초월하며 강력한 시각적 특징 학습 능력을 입증한다.
  • 더 깊은 ResNet-152 백본을 사용할 경우 Transformer 인코더 레이어 수를 늘리는 것보다 더 큰 성능 향상을 기록하며, 이는 시각적 특징 품질의 중요성을 강조한다.
  • 모델는 뛰어난 일반화 능력을 보이며, 단일 통합 아키텍처로도 비전-언어 이해 및 생성 작업 모두에서 양호한 성능을 달성한다.
  • 입력 이미지를 448×448로 리샘플링하면 추론 시간이 5배 감소하고 정확도 손실는 최소한으로 유지되어, 단일 단계 설계의 효율성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.