Skip to main content
QUICK REVIEW

[논문 리뷰] Weakly-supervised VisualBERT: Pre-training without Parallel Images and Captions

Liunian Harold Li, Haoxuan You|arXiv (Cornell University)|2020. 10. 24.
Multimodal Machine Learning Applications참고 문헌 47인용 수 7
한 줄 요약

이 논문은 이미지와 캡션의 쌍이 없는 데이터를 사용하여, 언어 전용 및 이미지 전용 코퍼스에서 마스크 및 예측 목적을 활용하고, 객체 검출 태그를 교차 모odal 앵커로 사용함으로써 이미지와 언어의 쌍이 없는 상태에서 사전 훈련하는 움직임이 약한 시각-언어 모델인 Weakly-supervised VisualBERT를 제안한다. 이는 완전히 감독된 사전 훈련 수준의 성능을 달성하며, 대규모 원시 이미지에서 사전 훈련을 수행할 경우 성능 향상이 더해진다.

ABSTRACT

Pre-trained contextual vision-and-language (V&L) models have brought impressive performance improvement on various benchmarks. However, the paired text-image data required for pre-training are hard to collect and scale up. We investigate if a strong V&L representation model can be learned without text-image pairs. We propose Weakly-supervised VisualBERT with the key idea of conducting mask-and-predict pre-training on language-only and image-only corpora. Additionally, we introduce the object tags detected by an object recognition model as anchor points to bridge two modalities. Evaluation on four V&L benchmarks shows that Weakly-supervised VisualBERT achieves similar performance with a model pre-trained with paired data. Besides, pre-training on more image-only data further improves a model that already has access to aligned data, suggesting the possibility of utilizing billions of raw images available to enhance V&L models.

연구 동기 및 목표

  • 강력한 시각-언어 표현을 쌍이 없는 이미지-캡션 데이터 없이 학습할 수 있는지 조사하는 것.
  • 시각-언어 모델의 훈련에 비용이 많이 들고 수집하기 어려운 쌍이 있는 훈련 데이터에 대한 의존도를 줄이는 것.
  • 비쌍이 있는 이미지 및 텍스트 코퍼스에서 마스크된 예측 목적을 사용하여 사전 훈련하는 것이 가능한지 탐색하는 것.
  • 비쌍 데이터가 존재하는 약한 감독 설정에서 객체 검출 태그가 시각과 언어 모odal 간의 연결을 효과적으로 수행할 수 있는지 평가하는 것.
  • 이미지 전용 사전 훈련을 대규모로 확장했을 때, 최종 시각-언어 성능에 미치는 영향을 평가하는 것.

제안 방법

  • 언어 전용 코퍼스에서 마스크된 언어 모델링 목적을 사용하여 모델을 사전 훈련한다.
  • 이미지 전용 코퍼스에서 마스크된 이미지 모델링 목적을 사용하여 모델을 사전 훈련한다.
  • 사전 훈련된 객체 검출기에서 유도된 객체 검출 태그를 교차 모달 앵커 포인트로 도입하여 시각적 및 텍스트 표현을 정렬한다.
  • 표준 피니팅 프rotocols를 사용하여 다운스트림 시각-언어 벤치마크에서 통합된 모델을 피니팅한다.
  • 다중 모달 트랜스포머 아키텍처를 사용하여 시각적 특징과 텍스트 토큰을 함께 인코딩하고, 교차 어텐션 메커니즘을 적용한다.
  • 객체 태그에서 유도된 대비 학습 신호를 사용하여 모달 간 정렬을 위해 모델을 엔드 투 엔드로 훈련한다.

실험 결과

연구 질문

  • RQ1사전 훈련 단계에서 어떤 이미지-캡션 쌍도 사용하지 않아도 시각-언어 모델이 강력한 성능을 달성할 수 있는가?
  • RQ2비쌍이 있는 이미지 및 텍스트 코퍼스에서 마스크된 사전 훈련이 감독된 사전 훈련과 비교해도 경쟁 가능한 표현을 생성할 수 있는가?
  • RQ3비쌍 데이터가 존재하는 상황에서 객체 검출 태그가 시각적 표현과 언어 표현을 효과적으로 정렬하는 데 교차 모달 앵커로 기능할 수 있는가?
  • RQ4쌍이 있는 데이터가 존재하는 상황에서 대규모 원시 이미지에서 사전 훈련을 수행하면 성능 향상이 이루어지는가?
  • RQ5약한 감독 설정에서 시각 전용 사전 훈련과 텍스트 전용 사전 훈련의 상대적 기여도는 어떠한가?

주요 결과

  • 움직임이 약한 VisualBERT는 쌍이 없는 이미지-캡션 데이터로 사전 훈련된 모델과 비교해도 네 개의 시각-언어 벤치마크에서 유사한 성능을 달성한다.
  • 쌍이 있는 데이터가 존재하는 상황에서도 대규모 이미지 전용 데이터에서의 사전 훈련이 모델 성능에 크게 기여함을 확인하여 원시 이미지의 가치를 입증한다.
  • 객체 검출 태그를 앵커로 사용함으로써 쌍이 없는 데이터가 존재하는 상황에서도 효과적인 교차 모달 정렬이 가능하다.
  • 비쌍이 있는 언어 및 이미지 코퍼스에서 마스크된 사전 훈련은 강력하고 일반화 능력이 뛰어난 시각-언어 표현을 생성한다.
  • 이미지 전용 사전 훈련에서의 성능 향상은 수십억 개의 원시 비쌍 이미지가 시각-언어 모델을 향상시킬 수 있음을 시사한다.
  • 결과적으로 약한 감독, 비쌍 데이터 기반의 소스에서 강력한 V&L 표현을 학습하는 것이 가능하다는 것을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.