Skip to main content
QUICK REVIEW

[논문 리뷰] Unsupervised Image Captioning

Yang Feng, Lin Ma|arXiv (Cornell University)|2018. 11. 27.
Multimodal Machine Learning Applications참고 문헌 43인용 수 10
한 줄 요약

이 논문은 이미지-문장 쌍 레이블이 전혀 없는 상태에서 캡션 생성 모델을 훈련시키는 최초의 비지도 이미지 캡션 생성 프레임워크를 제안한다. 문장 코퍼스를 활용해 적대적 문장 생성을 수행하고, 사전 훈련된 검출기로부터 시각적 개념 지식을 정제하며, 공유 잠재 공간 내에서 이중 방향 복원을 통해 이미지-캡션 일致성을 강화하여 MSCOCO에서 비쌍승 설정 하에 CIDEr 점수 54.9의 뛰어난 제로샷 성능을 달성한다.

ABSTRACT

Deep neural networks have achieved great successes on the image captioning task. However, most of the existing models depend heavily on paired image-sentence datasets, which are very expensive to acquire. In this paper, we make the first attempt to train an image captioning model in an unsupervised manner. Instead of relying on manually labeled image-sentence pairs, our proposed model merely requires an image set, a sentence corpus, and an existing visual concept detector. The sentence corpus is used to teach the captioning model how to generate plausible sentences. Meanwhile, the knowledge in the visual concept detector is distilled into the captioning model to guide the model to recognize the visual concepts in an image. In order to further encourage the generated captions to be semantically consistent with the image, the image and caption are projected into a common latent space so that they can reconstruct each other. Given that the existing sentence corpora are mainly designed for linguistic research and are thus with little reference to image contents, we crawl a large-scale image description corpus of two million natural sentences to facilitate the unsupervised image captioning scenario. Experimental results show that our proposed model is able to produce quite promising results without any caption annotations.

연구 동기 및 목표

  • 이미지 캡션 생성 모델 훈련에 비용이 많이 드는 쌍승 이미지-문장 데이터셋에 의존하는 것을 제거하기 위해.
  • 이미지 세트, 문장 코퍼스, 사전 훈련된 시각적 개념 검출기만을 사용하여 캡션 생성 모델을 훈련할 수 있도록 하기 위해.
  • 생성된 캡션문장이 언어적으로 타당하고 이미지 콘텐츠에 의미적으로 기반하며 다중 모odal 간에 일致하도록 보장하기 위해.
  • 비지도 사전 훈련을 통해 쌍승 데이터 없이도 경쟁 가능한 캡션 생성 성능를 달성할 수 있는지 탐색하기 위해.
  • 비지도 훈련을 지원하기 위해 200만 문장 규모의 대규모 이미지 기술서를 수집하고 공개하기 위해.

제안 방법

  • 실제 문장과 구분되지 않는 문장을 생성할 수 있도록, 대규모 문장 코퍼스를 사용해 적대적 훈련을 통해 언어 모델을 훈련한다.
  • 검출된 시각적 개념(예: 물체)을 생성된 캡션문장에 포함하도록 유도하는 개념 보상 메커니즘을 구현한다.
  • 이미지 및 문장 특징을 공유 잠재 공간에 투영하여 이중 방향 복원(이미지 → 캡션 및 캡션 → 이미지)을 가능하게 한다.
  • 쌍승 레이블 없이도 이미지 콘텐츠에 기반한 캡션 생성을 위한 감독 신호를 제공하기 위해 시각적 개념 검출기를 사용한다.
  • 적대적 생성, 개념 보상, 이미지-캡션 복원의 세 가지 목표를 통합하여 엔드 투 엔드로 훈련한다.
  • 이중 단계 훈련 파이프라인을 활용한다: 먼저 적대적 및 개념 보상 훈련을 통해 캡션 생성 모델을 사전 훈련한 후, 복원 목표를 통해 미세 조정한다.

실험 결과

연구 질문

  • RQ1어떤 딥러닝 모델이 어떤 쌍승 이미지-문장 레이블도 없이 고품질의 이미지 캡션을 생성할 수 있는가?
  • RQ2단일 언어 문장 코퍼스만을 사용하여 언어적으로 타당한 문장을 생성할 수 있는 캡션 생성 모델은 어떻게 훈련할 수 있는가?
  • RQ3쌍승 데이터 없이도 시각적 개념 검출을 얼마나 효과적으로 활용하여 캡션 생성을 이미지 콘텐츠에 기반시킬 수 있는가?
  • RQ4공유 잠재 공간 내에서 이미지-캡션 복원이 생성된 캡션과 입력 이미지 간의 의미 일치성을 향상시킬 수 있는가?
  • RQ5적대적 생성, 개념 보상, 복원의 조합이 비지도 캡션 생성에서 측정 가능한 성능 향상을 이끌 수 있는가?

주요 결과

  • 제안된 비지도 모델은 쌍승 설정 하에서 MSCOCO 테스트 세트에서 CIDEr 점수 54.9를 달성하여, 이전 연구들(예: pivoting [15])보다 뚜렷이 뛰어난 성능을 보였다.
  • 개념 보상의 포함으로 생성된 문장당 정확하게 식별된 시각적 개념의 평균 수가 초기화 없이 약 0.6에서 약 0.8로 증가하여 이미지 콘텐츠에 대한 더 나은 기반 확보가 이루어졌음을 입증했다.
  • 모든 세 가지 목표(적대적 생성, 개념 보상, 복원)를 포함한 전체 모델이 가장 높은 성능을 기록하여 CIDEr 점수 54.9를 달성했으며, 모든 구성 요소를 조합함으로써 상호 보완적인 성능 향상을 보였다.
  • 각 추가 목표에 따라 성능이 점진적으로 향상되었으며, 복원 없이 49.0에서 전체 복원을 적용한 54.9로 향상되어 이중 방향 복원의 효과를 확인했다.
  • 인간 레이블이 전혀 없는 상태에서도 모델은 타당하고 다양한, 의미적으로 일관된 캡션을 생성했으며, 이는 비지도 이미지 캡션 생성의 가능성에 대한 검증을 제공했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.