Skip to main content
QUICK REVIEW

[논문 리뷰] Unsupervised Vision-and-Language Pre-training Without Parallel Images and Captions

Liunian Harold Li, Haoxuan You|arXiv (Cornell University)|2020. 10. 24.
Multimodal Machine Learning Applications참고 문헌 55인용 수 6
한 줄 요약

이 논문은 비정렬 이미지-캡션 쌍이 없는 상황에서도 교차 모odal 표현을 학습할 수 있는 비지도 시각-언어 미리 훈련 방법인 Unsupervised VisualBERT (U-VisualBERT)를 제안한다. 이 방법은 비정렬 텍스트 및 이미지 코퍼스에 마스크 및 예측 목적을 적용하고, 객체 검출기 태그를 교차 모달 앵커 포인트로 사용한다. 이 방법은 네 가지 영문 V&L 벤치마크에서 지도 학습 모델과 비교할 만한 성능을 달성하여, 강력한 V&L 표현 학습을 위해 병렬 데이터가 반드시 필요하다는 전제를 도전한다.

ABSTRACT

Pre-trained contextual vision-and-language (V&L) models have achieved impressive performance on various benchmarks. However, existing models require a large amount of parallel image-caption data for pre-training. Such data are costly to collect and require cumbersome curation. Inspired by unsupervised machine translation, we investigate if a strong V&L representation model can be learned through unsupervised pre-training without image-caption corpora. In particular, we propose to conduct ``mask-and-predict'' pre-training on text-only and image-only corpora and introduce the object tags detected by an object recognition model as anchor points to bridge two modalities. We find that such a simple approach achieves performance close to a model pre-trained with aligned data, on four English V&L benchmarks. Our work challenges the widely held notion that aligned data is necessary for V&L pre-training, while significantly reducing the amount of supervision needed for V&L models.

연구 동기 및 목표

  • 강력한 시각-언어 표현을 병렬 이미지-캡션 데이터 없이 학습할 수 있는지 조사하기 위해.
  • 정렬된 데이터가 효과적인 시각-언어 미리 훈련을 위해 필수적이라는 널리 퍼진 믿음을 도전하기 위해.
  • 최소한의 감독 신호만을 사용하여 비정렬 텍스트 및 이미지 코퍼스를 이용한 비지도 미리 훈련을 탐색하기 위해.
  • 비정렬 데이터가 존재할 때 객체 검출기 태그가 효과적인 교차 모달 앵커 포인트로 기능할 수 있는지 평가하기 위해.
  • 병렬 데이터가 없는 상황에서 비정렬 데이터와 정렬 데이터를 조합한 반지도 학습의 잠재력을 평가하기 위해.

제안 방법

  • 모델은 텍스트 전용 코퍼스에 마스크 및 예측 목적을 적용하여 자연어 시퀀스에서 마스크된 단어를 예측한다.
  • 모델은 이미지 전용 코퍼스에 마스크 및 예측 목적을 적용하여 마스크된 시각적 영역과 그에 해당하는 검출된 객체 태그를 예측한다.
  • 객체 검출기 태그(예: '케이크', '자동차')는 시각 입력에 텍스트 토큰으로 첨부되어 교차 모달 정렬 신호를 생성한다.
  • 모델은 단일 트랜스포머 인코더를 사용하여 양방향 모달 입력을 처리함으로써 공동 표현 학습을 가능하게 한다.
  • 검출기 태그는 두 모달 간의 공통 어휘 요소로 기능하여, 쌍이 없는 예시 없이 암묵적인 교차 모달 기반을 제공한다.
  • 통제 실험은 정렬 여부에 따라 훈련된 모델을 비교하고, 탈락 분석을 통해 검출기 태그의 역할을 평가한다.

실험 결과

연구 질문

  • RQ1병렬 이미지-캡션 데이터가 전혀 없이도 강력한 시각-언어 표현을 학습할 수 있는가?
  • RQ2객체 검출기 태그가 비정렬 텍스트와 이미지 모달 간을 연결하는 효과적인 앵커 포인트로 기능하는가?
  • RQ3비지도 미리 훈련이 지도 미리 훈련에 비해 최종 작업 성능 측면에서 어떻게 비교되는가?
  • RQ4소량의 정렬 데이터와 함께 비정렬 이미지 데이터를 조합하면 반지도 학습 환경에서 성능 향상이 이루어지는가?
  • RQ5쌍이 없는 상황에서 검출기 태그가 교차 모달 정렬을 가능하게 하는 데 어떤 역할을 하는가?

주요 결과

  • NLVR2 벤치마크에서 U-VisualBERT는 70.49%의 정확도를 기록하여 지도 학습 모델인 S-VisualBERT의 70.90%에 근접한 성능을 달성했다.
  • VQA 벤치마크에서 U-VisualBERT는 67.4%의 상위 1 정확도를 기록했으며, 지도 기반 베이스라인의 67.7%에 비해 약간 낮았다.
  • GQA 벤치마크에서 U-VisualBERT는 71.1%의 정확도를 기록했으며, 지도 모델의 71.8%에 비해 略로 낮지만 여전히 매우 경쟁력 있는 성능을 보였다.
  • Flickr30K에서 U-VisualBERT는 이미지-텍스트 매칭 작업에서 81.2%의 성능을 기록하여 강력한 제로샷 전이 능력을 입증했다.
  • 탈락 분석 결과, 검출기 태그를 제거한 모델(U-VisualBERT_NT)은 성능이 크게 하락함을 확인하여, 태그가 핵심 정렬 신호로 기능한다는 점을 입증했다.
  • 300만 개의 정렬 이미지와 170만 개의 비정렬 이미지를 사용한 반지도 미리 훈련(H-VisualBERT)은 대부분의 작업에서 지도 미리 훈련보다 일관되게 성능 향상을 보였으며, 이는 비정렬 데이터의 가치를 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.