Skip to main content
QUICK REVIEW

[논문 리뷰] Unpaired Cross-lingual Image Caption Generation with Self-Supervised Rewards

Yuqing Song, Shizhe Chen|arXiv (Cornell University)|2019. 08. 15.
Multimodal Machine Learning Applications참고 문헌 35인용 수 5
한 줄 요약

이 논문은 쌍방향 훈련 데이터가 없는 조건에서 어휘의 자연스러움과 시각적 관련성을 향상시키는 자기지도 학습 강화학습 프레임워크를 제안한다. 어휘 자연스러움 보상은 단일 언어 문장집합을 활용하고, 시각적 관련성 보상은 다수준 시각-의미 일치 모델을 통해 도출된다. 이로 인해 영어 및 중국어 이미지 캡션 생성 벤치마크에서 이전 최고 성능 기준을 크게 뛰어넘는 성과를 달성한다.

ABSTRACT

Generating image descriptions in different languages is essential to satisfy users worldwide. However, it is prohibitively expensive to collect large-scale paired image-caption dataset for every target language which is critical for training descent image captioning models. Previous works tackle the unpaired cross-lingual image captioning problem through a pivot language, which is with the help of paired image-caption data in the pivot language and pivot-to-target machine translation models. However, such language-pivoted approach suffers from inaccuracy brought by the pivot-to-target translation, including disfluency and visual irrelevancy errors. In this paper, we propose to generate cross-lingual image captions with self-supervised rewards in the reinforcement learning framework to alleviate these two types of errors. We employ self-supervision from mono-lingual corpus in the target language to provide fluency reward, and propose a multi-level visual semantic matching model to provide both sentence-level and concept-level visual relevancy rewards. We conduct extensive experiments for unpaired cross-lingual image captioning in both English and Chinese respectively on two widely used image caption corpora. The proposed approach achieves significant performance improvement over state-of-the-art methods.

연구 동기 및 목표

  • 목표 언어에서 대규모 쌍방향 이미지-캡션 데이터셋이 가용하지 않을 때 고품질의 다국어 이미지 캡션 생성 문제를 해결하기 위해.
  • 언어 피봇 기반 캡션 생성 파이프라인에서 피봇-대상 번역에 의해 유도되는 어휘 불순함 및 시각적 관련성 부족 문제를 완화하기 위해.
  • 쌍방향 훈련 데이터가 없을 경우 자기지도 신호를 활용해 캡션 생성을 이끄는 강화학습 프레임워크를 개발하기 위해.
  • 단일 언어 텍스트 및 가짜 쌍방향 이미지-캡션 쌍에서 유도된 어휘 자연스러움 및 시각적 관련성 보상으로 캡션 품질을 향상시키기 위해.

제안 방법

  • 어휘 자연스러움 보상은 단일 언어 목표 언어 문장집합을 대상으로 언어 모델을 활용한 자기지도 사전학습을 통해 학습된다.
  • 문장 수준 및 개념 수준의 시각적 관련성 보상 계산을 위한 다수준 시각-의미 일치 모델(ML-VSE)이 제안된다.
  • ML-VSE 모델은 피봇-대상 번역 모델에 의해 생성된 가짜 쌍방향 이미지-캡션 쌍을 기반으로 훈련된다.
  • 보상 함수는 강화학습 프레임워크에 통합되어 캡션 생성기를 종합적으로 최적화된다.
  • 자기지도 어휘 자연스러움 및 시각적 관련성 신호를 동시에 최적화하여 쌍방향 데이터 의존도를 감소시킨다.
  • MSCOCO 및 AIC-ICC 데이터셋을 대상으로 영어 및 중국어 캡션 생성에 대해 평가된다.

실험 결과

연구 질문

  • RQ1쌍방향 훈련 데이터 없이 자기지도 보상 신호가 다국어 이미지 캡션 생성의 어휘 자연스러움을 향상시킬 수 있는가?
  • RQ2다수준 시각-의미 일치 모델이 번역된 캡션의 시각적 관련성 부족 문제를 효과적으로 줄일 수 있는가?
  • RQ3제안된 방법은 쌍방향 훈련 데이터가 없는 경우, 지도 학습 및 이전 비지도 기반 기준 대비 어떻게 성능을 내는가?
  • RQ4도메인 외부의 단일 언어 문장집합이 여전히 캡션 품질 향상에 기여할 수 있는가?

주요 결과

  • 제안된 방법은 영어 및 중국어 쌍방향 없는 이미지 캡션 생성 작업에서 최고 성능을 달성하며, 모든 표준 평가 지표에서 이전 방법을 뛰어넘는다.
  • MSCOCO 테스트 세트에서 CIDEr 점수는 28.2, Meteor 점수는 14.2를 기록하여 기준 모델 대비 뚜렷한 향상을 보였다.
  • 인간 평가 결과 어휘 자연스러움 점수는 4.8, 관련성 점수는 3.8로, 캡션 품질 향상이 뚜렷하게 확인되었다.
  • 쌍방향 훈련 데이터를 0개 사용함에도 불구하고, 4,000개의 쌍방향 예제로 훈련된 지도 학습 모델과 유사한 성능을 보였다.
  • 도메인 외부의 단일 언어 문장집합을 사용하더라도 언어 모델이 여전히 캡션 품질 향상에 기여함을 입증하여 강력한 일반화 능력을 보였다.
  • 다수준 시각-의미 일치 모델은 개념 검색 결과를 통해 거시적 및 미시적 수준의 시각-텍스트 일치를 효과적으로 포착함을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.