Skip to main content
QUICK REVIEW

[논문 리뷰] VIVO: Visual Vocabulary Pre-Training for Novel Object Captioning

Xiaowei Hu, Xi Yin|arXiv (Cornell University)|2020. 09. 28.
Multimodal Machine Learning Applications참고 문헌 53인용 수 16
한 줄 요약

이 논문은 이미지-태그 쌍에서 이미지-캡션 애너테이션을 필요로 하지 않고, 헝가리안 매칭 손실을 사용한 마스킹 태그 예측 작업을 통해 다중모odal 표현을 학습하는 시각어휘 사전학습 방법 VIVO를 제안한다. 대규모 이미지-태그 데이터에서의 사전학습은 이미지 캡션에서 새로운 객체에 대한 최신 기술 수준의 제로샷 일반화를 가능하게 하며, CIDEr 점수가 77.8로 nocaps 벤치마크에서 인간 성능을 초월한다.

ABSTRACT

It is highly desirable yet challenging to generate image captions that can describe novel objects which are unseen in caption-labeled training data, a capability that is evaluated in the novel object captioning challenge (nocaps). In this challenge, no additional image-caption training data, other thanCOCO Captions, is allowed for model training. Thus, conventional Vision-Language Pre-training (VLP) methods cannot be applied. This paper presents VIsual VOcabulary pretraining (VIVO) that performs pre-training in the absence of caption annotations. By breaking the dependency of paired image-caption training data in VLP, VIVO can leverage large amounts of paired image-tag data to learn a visual vocabulary. This is done by pre-training a multi-layer Transformer model that learns to align image-level tags with their corresponding image region features. To address the unordered nature of image tags, VIVO uses a Hungarian matching loss with masked tag prediction to conduct pre-training. We validate the effectiveness of VIVO by fine-tuning the pre-trained model for image captioning. In addition, we perform an analysis of the visual-text alignment inferred by our model. The results show that our model can not only generate fluent image captions that describe novel objects, but also identify the locations of these objects. Our single model has achieved new state-of-the-art results on nocaps and surpassed the human CIDEr score.

연구 동기 및 목표

  • 이미지-캡션 학습 데이터에서 볼 수 없는 새로운 객체에 대한 캡션 생성 문제에 대응한다.
  • 이미지-캡션 데이터 쌍에 의존하는 기존 시각어휘 사전학습(VLP)의 한계를 극복한다.
  • 대규모의 약한 지도 학습 이미지-태그 데이터를 활용해 일반화 능력을 향상시키기 위해 시각어휘를 사전학습한다.
  • 사전학습된 시각-의미 표현 공간을 통해 이미지 캡션에서 새로운 시각적 개념에 대한 제로샷 일반화를 가능하게 한다.
  • nocaps 벤치마크에서 최고 성능을 달성하며 인간의 CIDEr 점수를 초월한다.

제안 방법

  • 대규모 이미지-태그 쌍에서 다층 트랜스포머 모델을 사전학습하여 공동의 시각-텍스트 임베딩 공간을 학습한다.
  • 마스킹 태그 예측을 사전학습 목적으로 사용하며, 하나 이상의 태그를 마스킹하고 이미지 영역 특징과 마스킹되지 않은 태그를 기반으로 예측한다.
  • 이미지 태그의 순서가 없는 성격을 고려해 헝가리안 매칭 손실을 적용하여 예측된 태그와 진짜 태그 간의 정확한 정렬을 보장한다.
  • 의미적으로 유사한 객체(예: 'person'과 'man')를 시각어휘 공간 내에서 가까운 벡터 표현으로 매핑하도록 모델을 훈련한다.
  • 캡션 생성의 유창성과 근거 기반 성능 향상을 위해 COCO 이미지-캡션 쌍에서 사전학습 모델을 미세조정한다.
  • 추론에 단일 모델을 사용하여, 미세조정 중에 볼 수 없었던 새로운 객체에 대한 제로샷 캡션 생성을 가능하게 한다.

실험 결과

연구 질문

  • RQ1이미지-캡션 애너테이션을 사용하지 않고 이미지-태그 쌍에서 효과적으로 시각어휘를 학습할 수 있는가?
  • RQ2대규모 이미지-태그 데이터에서의 사전학습이 이미지 캡션에서 새로운 객체에 대한 제로샷 일반화를 향상시키는가?
  • RQ3마스킹 태그 예측과 함께 헝가리안 매칭 손실이 순서 없는 시각-텍스트 정렬을 학습하는 데 얼마나 효과적인가?
  • RQ4약한 지도 학습 이미지-태그 데이터에서 사전학습된 모델이 기존 방법보다 nocaps 벤치마크에서 더 우수한 성능을 내는가?
  • RQ5시각어휘의 크기(태그 클래스 수)가 최종 캡션 생성 성능에 미치는 영향은 어느 정도인가?

주요 결과

  • VIVO 사전학습은 nocaps 벤치마크에서 이미지 캡션 성능을 크게 향상시켜 CIDEr 점수 77.8을 기록하며 인간의 CIDEr 점수를 초월한다.
  • 사전학습에 6.4K개의 태그 클래스를 사용할 경우, 사전학습 없이 기준 모델 대비 CIDEr 점수 6.9% 향상되며 더 큰 시각어휘의 이점이 입증된다.
  • 마스킹 태그 예측과 함께 헝가리안 매칭 손실은 단일 토큰 마스킹 및 헝가리안 매칭 없이 사용하는 것보다 우수하며, CIDEr 점수 2.9점 향상된다.
  • 모델는 강력한 제로샷 일반화 성능을 보이며, 미세조정 중에 본 적이 없는 새로운 객체(예: 'accordion')를 정확하게 기술한다.
  • 사전학습 과정에서 학습된 시각어휘는 의미적으로 유사한 객체를 가까운 벡터 표현으로 매핑하여 복합적 일반화를 가능하게 한다.
  • COCO(시각적 개념이 제한된 데이터셋)에서 미세조정을 거친 후에도 VIVO 사전학습 모델은 다양하고 오픈 뷰포인트의 nocaps 테스트 세트에 효과적으로 일반화된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.