Skip to main content
QUICK REVIEW

[논문 리뷰] Object-driven Text-to-Image Synthesis via Adversarial Training

Wenbo Li, Pengchuan Zhang|arXiv (Cornell University)|2019. 02. 27.
Generative Adversarial Networks and Image Synthesis참고 문헌 33인용 수 46
한 줄 요약

Obj-GAN은 객체 기반 주의 생성과 객체 단위 구분을 도입하여 텍스트에서 복합 장면을 합성하고, 이전 방법들보다 COCO 결과를 개선합니다.

ABSTRACT

In this paper, we propose Object-driven Attentive Generative Adversarial Newtorks (Obj-GANs) that allow object-centered text-to-image synthesis for complex scenes. Following the two-step (layout-image) generation process, a novel object-driven attentive image generator is proposed to synthesize salient objects by paying attention to the most relevant words in the text description and the pre-generated semantic layout. In addition, a new Fast R-CNN based object-wise discriminator is proposed to provide rich object-wise discrimination signals on whether the synthesized object matches the text description and the pre-generated layout. The proposed Obj-GAN significantly outperforms the previous state of the art in various metrics on the large-scale COCO benchmark, increasing the Inception score by 27% and decreasing the FID score by 11%. A thorough comparison between the traditional grid attention and the new object-driven attention is provided through analyzing their mechanisms and visualizing their attention layers, showing insights of how the proposed model generates complex scenes in high quality.

연구 동기 및 목표

  • 복잡한 텍스트 설명에서 고품질의 의미적으로 의미 있는 이미지를 생성하려는 동기.
  • COCO 규모의 장면을 다루기 위해 객체와 그 관계를 명시적으로 모델링할 필요성.
  • 생성 과정에서 단어 수준과 객체 수준 정보를 활용하기 위한 객체 기반 주의 메커니즘 개발.
  • 레이아웃에 맞춰 객체 수준 피드백을 제공하는 객체별 구분기 도입하여 객체 수준 피드백 제공.

제안 방법

  • 두 단계 생성: 의미 레이아웃(경계 상자 및 모양)부터 이미지 합성.
  • 각 객체 영역에 대해 단어 맥락을 조회하기 위해 클래스 라벨을 사용하는 객체 기반 주의 이미지 생성기.
  • 텍스트와 레이아웃에 대해 각 경계 상자를 평가하는 객체별 Fast R-CNN 기반 구분기.
  • 객체별 단어 맥артам을 계산하고 이를 객체 영역 간에 맥락을 분배하는 객체 기반 주의 메커니즘.
  • 패치-와이즈 구분기들은 무조건적 및 텍스트 조건 피드백을 제공; 최종 단계의 객체별 구분기가 객체별 피드백을 제공.
  • 손실은 GAN 목표와 단어-이미지 정렬을 위한 DAMSM 크로스 모달 유사도 손실을 결합한 방식으로 구성.

실험 결과

연구 질문

  • RQ1객체 기반 주의가 상세하고 다중 객체의 이미지 합성을 텍스트 설명에서 개선할 수 있는가?
  • RQ2객체별 구분 및 레이아웃 조건화를 도입하면 COCO 규모의 장면에서 사실감과 레이아웃 충실도가 향상되는가?
  • RQ3객체 기반 주의는 고품질 생성을 이끄는 데 그리드 주의와 비교해 어떤 차이가 있는가?
  • RQ4Ground-truth 레이아웃과 예측 레이아웃 사용이 합성 품질에 어떤 영향을 미치는가?
  • RQ5제안된 구성 요소들이 새로운 희귀한 장면 설명에 일반화되는가?

주요 결과

  • Obj-GAN은 COCO 텍스트-이미지 합성 성능을 이전 방법보다 크게 향상시킨다.
  • 객체 기반 주의 사용 시 그리드 주의 변형보다 더 높은 Inception 점수와 더 낮은 FID를 얻는다.
  • Ground-truth 레이아웃을 활용한 Obj-GAN은 최상의 정성적·정량적 결과를 달성하며 레이아웃 품질의 영향을 보여준다.
  • 절단 연구에서 객체 기반 주의가 그리드 주의보다 앞뒤 텍스처의 일관성을 높인다는 것을 보여준다.
  • Obj-GAN-SOTA 변형들은 연구에서 COCO 벤치마크에서 최상의 지표를 달성한다.
  • 정성적 결과는 새로운 묘사를 포함한 더 나은 객체 충실도와 장면 일관성을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.