Skip to main content
QUICK REVIEW

[논문 리뷰] I2T2I: Learning Text to Image Synthesis with Textual Data Augmentation

Hao Dong, Jingqing Zhang|arXiv (Cornell University)|2017. 03. 20.
Multimodal Machine Learning Applications인용 수 18
한 줄 요약

이 논문은 이미지 캡션 생성과 이미지-텍스트 매핑을 통해 텍스트 데이터 증강을 활용함으로써 텍스트-이미지 합성 품질을 향상시키는 새로운 훈련 방법 I2T2I를 제안한다. 사전 훈련된 이미지 캡션 모듈, GAN 기반 생성기, 그리고 대비적 이미지-텍스트 임베딩 모듈를 함께 훈련시킴으로써, MSCOCO와 같은 다중 카테고리 데이터셋에서 생성 품질을 향상시키고, 인간이 주석을 달지 않은 MPII Human Pose 데이터셋에서도 제로샷 전이 학습을 가능하게 하여 복잡한 인간과 물체 생성에서 뛰어난 세부 사항과 현실성 구현을 달성한다.

ABSTRACT

Translating information between text and image is a fundamental problem in artificial intelligence that connects natural language processing and computer vision. In the past few years, performance in image caption generation has seen significant improvement through the adoption of recurrent neural networks (RNN). Meanwhile, text-to-image generation begun to generate plausible images using datasets of specific categories like birds and flowers. We've even seen image generation from multi-category datasets such as the Microsoft Common Objects in Context (MSCOCO) through the use of generative adversarial networks (GANs). Synthesizing objects with a complex shape, however, is still challenging. For example, animals and humans have many degrees of freedom, which means that they can take on many complex shapes. We propose a new training method called Image-Text-Image (I2T2I) which integrates text-to-image and image-to-text (image captioning) synthesis to improve the performance of text-to-image synthesis. We demonstrate that %the capability of our method to understand the sentence descriptions, so as to I2T2I can generate better multi-categories images using MSCOCO than the state-of-the-art. We also demonstrate that I2T2I can achieve transfer learning by using a pre-trained image captioning module to generate human images on the MPII Human Pose

연구 동기 및 목표

  • 복잡하고 변동성이 큰 대상(예: 인간, 동물)에 대해 다중 모odal 텍스트-이미지 생성의 과제를 해결하기 위해.
  • MSCOCO와 같은 데이터셋에서 다양하고 다중 기술적 주석의 부족으로 인해 텍스트-이미지 합성 성능에 제한이 생기는 문제를 해결하기 위해.
  • MPII Human Pose 데이터셋처럼 문장 주석이 없는 이미지 데이터셋에서도 제로샷 전이 학습을 가능하게 하기 위해.
  • 특히 복잡한 형태와 동적인 자세를 가진 대상의 생성 품질과 세부 사항을 향상시키기 위해.

제안 방법

  • I2T2I는 세 가지 모듈을 통합한다: 텍스트 데이터 증강을 위한 이미지 캡션 모듈, 시각-세맨틱 임베딩을 위한 이미지-텍스트 매핑 모듈, GAN 기반 이미지 생성 모듈.
  • 이미지 캡션 모듈은 LSTM 디코더를 사용하여 각 이미지당 다수의 다양한 캡션을 생성하며, top-k 샘플링(k=3)을 통해 훈련 데이터의 다양성을 높인다.
  • 이미지-텍스트 매핑 모듈은 코사인 유사도 기반의 대비 손실 함수를 사용하여 공통 잠재 공간 내에서 이미지와 문장 임베딩을 정렬하며, 일치하는 쌍 간의 유사도를 최대화하고 불일치하는 쌍 간의 유사도를 최소화한다.
  • GAN-CLS 생성기는 이미지 캡션 임베딩과 노이즈 벡터 양쪽 모두에 조건을 받으며, 이미지-텍스트 모듈의 RNN 인코더를 재사용하여 의미적 정렬을 향상시킨다.
  • 훈련 중에 각 반복마다 합성 캡션을 재생성하고, 무작위 회전, 뒤집기, 자르기 등을 통해 이미지에 데이터 증강을 적용한다.
  • Adam 최적화를 사용한 엔드 투 엔드 훈련을 수행하며, 학습률 감소를 적용하고, 캡션 생성 및 GAN 모듈를 함께 최적화한다.

실험 결과

연구 질문

  • RQ1이미지 캡션을 통한 텍스트 데이터 증강이 MSCOCO와 같은 다중 카테고리 데이터셋에서 텍스트-이미지 합성의 품질과 다양성 향상에 기여하는가?
  • RQ2I2T2I 프레임워크는 인간이 주석을 달지 않은 데이터셋, 예를 들어 MPII Human Pose 데이터셋에서도 효과적인 제로샷 전이 학습을 가능하게 하는가?
  • RQ3이미지 캡션과 이미지-텍스트 매핑의 통합이 인간이나 동물과 같은 복잡하고 변동성이 큰 대상을 생성하는 데 모델의 능력을 향상시키는가?
  • RQ4I2T2I는 GAN-CLS와 같은 최첨단 기법에 비해 더 세밀하고 현실적인 이미지를 생성하는 데에서 어떤가?

주요 결과

  • I2T2I는 MSCOCO 검증 세트에서 GAN-CLS보다 고화질 이미지를 더 잘 생성하며, 특히 인간 다리, 파도, 화장실, 버스와 같은 복잡한 물체의 세부 사항을 잘 포착한다.
  • 이 방법은 인간의 주석이 없는 상태에서 MSCOCO에서 사전 훈련된 이미지 캡션 모듈만을 사용하여 MPII Human Pose 데이터셋에서 현실적인 인간 자세와 역동적인 장면을 성공적으로 합성한다.
  • 정성적 결과에서는 I2T2I가 GAN-CLS에 비해 더 정확하고 세밀한 복잡한 형태와 다중 객체 장면의 표현을 생성함을 보여준다.
  • 이미지 캡션 모듈을 통해 생성된 합성 캡션의 사용은 훈련 데이터의 다양성과 강건성을 크게 향상시키며, 동일한 이미지에 대한 다수의 기술 설명에 대해 생성기가 일반화하는 능력을 향상시킨다.
  • 캡션 생성, 임베딩, GAN 모듈의 공동 훈련은 의미적 정렬을 향상시키고, 새로운 데이터셋에 대한 더 나은 제로샷 전이 성능을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.