Skip to main content
QUICK REVIEW

[논문 리뷰] FBC-GAN: Diverse and Flexible Image Synthesis via Foreground-Background Composition

Kaiwen Cui, Gongjie Zhang|arXiv (Cornell University)|2021. 07. 07.
Generative Adversarial Networks and Image Synthesis참고 문헌 61인용 수 5
한 줄 요약

FBC-GAN은 전경 객체와 배경 풍경을 별도로 합성한 후 스타일과 기하학적 일관성으로 조합하여 이미지를 생성하는 혁신적인 GAN 아키텍처를 제안한다. 전경과 배경 생성을 분리함으로써 더 높은 다양성과 유연성을 달성하며, 다양한 데이터셋 간에 제로샷 조합이 가능해지지만, 적응형 스타일 정렬과 기하 보정을 통해 시각적 사실성도 유지한다.

ABSTRACT

Generative Adversarial Networks (GANs) have become the de-facto standard in image synthesis. However, without considering the foreground-background decomposition, existing GANs tend to capture excessive content correlation between foreground and background, thus constraining the diversity in image generation. This paper presents a novel Foreground-Background Composition GAN (FBC-GAN) that performs image generation by generating foreground objects and background scenes concurrently and independently, followed by composing them with style and geometrical consistency. With this explicit design, FBC-GAN can generate images with foregrounds and backgrounds that are mutually independent in contents, thus lifting the undesirably learned content correlation constraint and achieving superior diversity. It also provides excellent flexibility by allowing the same foreground object with different background scenes, the same background scene with varying foreground objects, or the same foreground object and background scene with different object positions, sizes and poses. It can compose foreground objects and background scenes sampled from different datasets as well. Extensive experiments over multiple datasets show that FBC-GAN achieves competitive visual realism and superior diversity as compared with state-of-the-art methods.

연구 동기 및 목표

  • 기존 GAN이 전경과 배경 간 과도한 콘텐츠 상관관계로 인해 다양성이 떨어지는 문제를 해결하기 위해.
  • 일반적인 GAN이 단일 단계의 잠재 코드 의존 방식으로 생성하기 때문에 영향력이 떨어지는 문제를 해결하기 위해.
  • 전경과 배경 콘텐츠를 독립적으로 제어할 수 있도록 하여, 동일한 전경에 다른 배경을 조합하거나 그 반대로 유연한 조합이 가능하도록 하기 위해.
  • 쌍체 훈련 데이터가 없더라도 독립적으로 생성된 전경과 배경 요소 간의 스타일과 기하 일관성을 확보하기 위해.
  • 다른 데이터셋의 전경과 배경을 조합하여 제로샷 이미지 생성을 가능하게 하여, 훈련 데이터 분포를 초월한 새로운 사실을 생성할 수 있도록 하기 위해.

제안 방법

  • 이미지 생성을 두 개의 독립적인 브랜치로 분해: 각각 전경 생성기(FG-Gen)와 배경 생성기(BG-Gen)로, 각각 별도의 잠재 코드에 조건화된다.
  • AdaIN 기반 스타일 정렬을 적용하여 전경 특징이 생성된 배경의 스타일에 적응하도록 하여 시각적 조화를 확보한다.
  • 전경 객체 레이아웃(위치, 크기, 자세)을 예측하는 형태 생성기(S-Gen)와 배경 특징을 기하학적으로 타당하게 조정하기 위한 배경 수정기(BG-Mod)를 도입한다.
  • 공간 정렬을 통해 생성된 전경과 배경을 융합하는 조합 모듈을 사용하여 의미적 및 구조적 일관성을 유지한다.
  • 모델을 엔드 투 엔드로 훈련시키며, 적대적 손실, 사이클 일관성 손실, 인지적 손실을 사용하여 사실성과 정렬을 보장한다.
  • 분리된 잠재 공간을 활용하여 서로 다른 데이터셋의 전경과 배경을 제로샷 조합할 수 있도록 한다.

실험 결과

연구 질문

  • RQ1독립적인 전경과 배경 생성이 불필요한 콘텐츠 상관관계를 감소시키고 이미지 생성의 다양성을 향상시키는가?
  • RQ2독립적으로 생성된 전경과 배경 요소 간의 스타일과 기하 일관성을 어떻게 확보할 수 있는가?
  • RQ3FBC-GAN이 서로 다른 데이터셋의 전경과 배경을 조합하여 얼마나 현실적인 이미지를 생성할 수 있는가?
  • RQ4제안된 방법이 재학습이나 추가 조건 없이도 객체의 위치, 크기, 자세를 영향력 있게 제어할 수 있는가?
  • RQ5기존 최고 수준의 GAN과 비교해 FBC-GAN은 이미지 합성에서 다양성과 사실성 측면에서 얼마나 뛰어나게 성능을 내는가?

주요 결과

  • FBC-GAN은 전경과 배경 콘텐츠 학습을 분리함으로써 더 높은 다양성을 달성하며, 부적절한 동시 발생 상관관계를 감소시킨다.
  • 스타일 정렬 메커니즘이 다섯 개의 데이터셋에서 측정된 스타일 관련성 측정치를 통해 전경과 배경 간의 스타일 호환성을 뚜렷이 향상시킨다.
  • BG-Mod를 통한 기하 일관성 보정은 인지적 품질과 기하학적 타당성을 향상시키며, 정성적 분석에서 공간 일관성 향상이 명확하게 드러난다.
  • FBC-GAN은 서로 다른 데이터셋의 전경과 배경을 조합하여 현실적인 이미지를 성공적으로 구성하며, 훈련 데이터 분포를 초월한 '새로운 정보' 생성 능력을 입증한다.
  • 모델은 동일한 전경에 여러 배경을 조합하거나, 동일한 배경에 다양한 전경을 조합하는 제로샷 조합을 가능하게 하며, 위치, 크기, 자세의 변화도 수용한다.
  • 정량적 평가에서 FBC-GAN은 특히 제로샷 및 데이터셋 간 조합 설정에서 기존 방법들을 뛰어넘는 시각적 사실성과 다양성에서 뛰어난 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.