Skip to main content
QUICK REVIEW

[논문 리뷰] Semantics Disentangling for Text-to-Image Generation

Guojun Yin, Bin Liu|arXiv (Cornell University)|2019. 04. 02.
Generative Adversarial Networks and Image Synthesis참고 문헌 38인용 수 12
한 줄 요약

이 논문은 CUB 및 MS-COCO 데이터셋에서 이미지 생성의 일관성과 세부 사항의 정확성을 향상시키기 위해 다양한 언어적 기술서에서 의미를 분리하는 SD-GAN이라는 텍스트-이미지 생성 모델을 제안한다. 이는 고수준의 의미 일관성을 추출하기 위해 시아모이드 분류기(Siamese discriminator)를 사용하고, 세부적인 언어적 단서를 통합하기 위해 의미 조건부 배치 정규화(semantic-conditioned batch normalization, SCBN) 레이어를 도입하여 최신 기술 성능을 달성한다.

ABSTRACT

Synthesizing photo-realistic images from text descriptions is a challenging problem. Previous studies have shown remarkable progresses on visual quality of the generated images. In this paper, we consider semantics from the input text descriptions in helping render photo-realistic images. However, diverse linguistic expressions pose challenges in extracting consistent semantics even they depict the same thing. To this end, we propose a novel photo-realistic text-to-image generation model that implicitly disentangles semantics to both fulfill the high-level semantic consistency and low-level semantic diversity. To be specific, we design (1) a Siamese mechanism in the discriminator to learn consistent high-level semantics, and (2) a visual-semantic embedding strategy by semantic-conditioned batch normalization to find diverse low-level semantics. Extensive experiments and ablation studies on CUB and MS-COCO datasets demonstrate the superiority of the proposed method in comparison to state-of-the-art methods.

연구 동기 및 목표

  • 동일한 이미지에 대한 다양한 언어적 기술서에서 기인하는 일관성 없는 이미지 생성 문제를 해결하기 위해.
  • 다양한 텍스트 기술서 동안 고수준의 의미 일관성을 유지하면서도 저수준의 의미 다양성과 세부 사항을 유지하기 위해.
  • 명시적인 텍스트-의미 임베딩이 필요 없이 텍스트-이미지 생성 과정에서 의미를 암묵적으로 분리하는 새로운 프레임워크를 도입하기 위해.
  • CUB 및 MS-COCO와 같은 벤치마크 데이터셋에서 생성 품질과 일관성을 향상시키기 위해.

제안 방법

  • 대조 손실을 통해 의미 일관성을 강제하기 위해, 텍스트 기술서의 쌍을 비교하는 데 시아모이드 분류기 아키텍처를 사용한다.
  • 시아모이드 구조는 두 개의 텍스트-이미지 쌍을 동시에 처리하며, 동일한 이미지이지만 다른 기술서인 내부 클래스 쌍의 경우 특징 간 거리를 최소화하고, 다른 이미지인 외부 클래스 쌍의 경우 이를 최대화한다.
  • 언어적 단서를 특징 맵에 통합하기 위해 의미 조건부 배치 정규화(semantic-conditioned batch normalization, SCBN)를 도입한다. 이는 세밀한 시각적 제어를 가능하게 한다.
  • SCBN은 문장 수준 또는 단어 수준의 텍스트 임베딩을 사용하여 배치 정규화 통계를 조절함으로써 생성 과정 중 특징 맵의 동적 적응을 가능하게 한다.
  • 모델은 병합된 생성적 적대적 손실과 대조 손실을 함께 최적화하여 이미지의 현실성과 의미 일치도를 동시에 향상시킨다.
  • 프레임워크는 FID 및 Inception Score 메트릭을 사용하여 CUB-200 및 MS-COCO 데이터셋에서 평가된다.

실험 결과

연구 질문

  • RQ1시아모이드 분류기 아키텍처는 동일한 이미지에 대한 다양한 언어적 기술서에서 고수준의 의미 일관성을 효과적으로 학습할 수 있는가?
  • RQ2이미지 생성 과정에서 텍스트의 저수준 의미 세부 정보와 다양성을 어떻게 유지할 수 있는가? 이를 통해 과도하게 매끄럽게 되거나 세부 특징이 손실되는 것을 방지할 수 있는가?
  • RQ3의미 조건부 배치 정규화(SCBN)가 연결된 텍스트 특징을 사용한 표준 배치 정규화보다 시각-의미 일치에서 우수한 성능을 보일 수 있는가?
  • RQ4생성기의 다양한 단계에서 대조 손실이 전체 생성 품질과 일관성에 기여하는 정도는 어떠한가?

주요 결과

  • 제안된 SD-GAN은 Fréchet Inception Distance(FID)가 4.67±0.09로 CUB-200 데이터셋에서 최신 기술 성능을 달성한다.
  • 대규모 MS-COCO 데이터셋에서는 FID가 35.69±0.50을 기록하여 이전 방법들을 능가한다.
  • 제거 실험 결과, 세 단계(D1, D2, D3) 전부에 대조 손실을 적용할 경우 최고의 성능을 기록하며, CUB에서는 FID 4.67±0.09, MS-COCO에서는 FID 35.69±0.50를 달성한다.
  • 단어 수준의 언어적 단서를 사용한 SCBN이 문장 수준의 단서보다 우수한 성능을 보이며, CUB에서는 FID 4.45를 기록한 반면 문장 수준은 4.39를 기록한다.
  • SCBN을 표준 배치 정규화로 대체하고 텍스트 특징를 연결하는 경우 성능이 악화됨을 확인하여, SCBN이 시각-의미 임베딩에서 열등함을 입증한다.
  • 모델은 언어적 다양성에 뛰어난 강인성을 보이며, 입력 기술서의 어휘적 표현 방식이 크게 다를 경우에도 일관된 이미지를 생성한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.