Skip to main content
QUICK REVIEW

[논문 리뷰] Semantic Bottleneck Scene Generation

Samaneh Azadi, Michael Tschannen|arXiv (Cornell University)|2019. 11. 26.
Generative Adversarial Networks and Image Synthesis참고 문헌 45인용 수 8
한 줄 요약

이 논문은 무조건적 복잡한 시나리오 합성에서 최고 성능을 내는 새로운 생성 모델인 의미적 복잡도 GAN(SB-GAN)을 제안한다. SB-GAN은 먼저 임의의 노이즈에서 현실적인 세분화 맵을 합성한 후, 그 맵을 조건으로 하여 고해상도 이미지를 생성한다. 분할 및 이미지 생성 네트워크를 종단 간(end-to-end)으로 훈련시킴으로써, Cityscapes와 ADE-Indoor에서 무조건적 복잡한 시나리오 합성에서 기존 방법들을 능가하는 FID 점수와 사용자 연구 결과를 달성한다.

ABSTRACT

Coupling the high-fidelity generation capabilities of label-conditional image synthesis methods with the flexibility of unconditional generative models, we propose a semantic bottleneck GAN model for unconditional synthesis of complex scenes. We assume pixel-wise segmentation labels are available during training and use them to learn the scene structure. During inference, our model first synthesizes a realistic segmentation layout from scratch, then synthesizes a realistic scene conditioned on that layout. For the former, we use an unconditional progressive segmentation generation network that captures the distribution of realistic semantic scene layouts. For the latter, we use a conditional segmentation-to-image synthesis network that captures the distribution of photo-realistic images conditioned on the semantic layout. When trained end-to-end, the resulting model outperforms state-of-the-art generative models in unsupervised image synthesis on two challenging domains in terms of the Frechet Inception Distance and user-study evaluations. Moreover, we demonstrate the generated segmentation maps can be used as additional training data to strongly improve recent segmentation-to-image synthesis networks.

연구 동기 및 목표

  • 조건부 GAN의 한계를 해결하기 위해, 지도 데이터로 제공된 세분화 맵이 필요로 하는 제약을 줄여 무조건적 시나리오 생성의 유연성을 높이기 위해.
  • 라벨 조건부 모델의 고해상도 이미지 생성 능력과 노이즈 기반 GAN의 무조건적 유연성을 결합하기 위해.
  • 전반적인 시나리오 구조는 의미적 레이아웃 생성을 통해 모델링하고, 국소적 세부 사항은 조건부 이미지 합성으로 분리된 표현을 학습하기 위해.
  • 기존 의미적 이미지 합성 모델의 성능을 향상시키기 위해, 훈련 중에 생성된 합성 세분화 맵을 추가 훈련 데이터로 활용하기 위해.

제안 방법

  • 모델은 이중 단계 파이프라인을 사용한다: 첫째, 무조건적 渐진적(Progressive) 세분화 생성 네트워크가 임의의 노이즈에서 현실적인 픽셀 단위의 의미적 레이블 맵을 합성한다.
  • 둘째, 조건부 세분화에서 이미지로의 합성 네트워크가 합성된 의미적 레이아웃을 조건으로 하여 사진 수준의 현실감 있는 이미지를 생성한다.
  • 세분화 생성기는 현실적인 외관을 갖춘 레이아웃을 생성하기 위해 적대적 판별기로 훈련되며, 이미지 생성기는 조건부 및 무조건적 판별기를 모두 사용하여 현실성과 일관성을 확보한다.
  • 종단 간 훈련을 통해 두 구성 요소를 동시에 최적화함으로써, 의미적으로 일관되고 고품질의 이미지 합성에 유리한 레이아웃을 생성할 수 있도록 한다.
  • 학습 안정성과 샘플 품질 향상을 위해 점진적 훈련과 다중 판별기 기반 적대적 훈련을 활용한다.
  • 훈련 중에 생성된 합성 세분화 맵은 기존의 조건부 모델(SPADE 등)을 재학습시키는 데 재사용되어, 실제 지도 데이터 레이블에서의 성능 향상을 이룬다.

실험 결과

연구 질문

  • RQ1무조건적으로 복잡하고 고해상도의 시나리오를 생성하면서도 전반적인 구조적 일관성과 국소적 현실감을 유지할 수 있는가?
  • RQ2GAN이 생성한 의미적 레이아웃이 고해상도 이미지 합성에 있어 의미 있고 현실적인 복잡도 블로킹 요소로 기능할 수 있는가?
  • RQ3세분화 생성기와 이미지 생성기를 종단 간으로 훈련시키는 것이 별도로 훈련시키는 것보다 성능을 향상시키는가?
  • RQ4이 모델이 생성한 합성 세분화 맵을 기존 의미적 이미지 합성 네트워크의 훈련 데이터로 사용하면 성능 향상이 이루어지는가?

주요 결과

  • SB-GAN은 Cityscapes-5k(58.67)와 Cityscapes-25k(54.13)에서 최고 성능을 기록한 FID 점수를 달성하여, ProGAN과 BigGAN보다 무조건적 이미지 합성에서 앞서며 최고 성능을 기록했다.
  • ADE-Indoor 데이터셋에서 SB-GAN은 FID 48.15를 기록하여 기준 모델인 SPADE보다 뚜렷이 향상된 성능을 보였다.
  • Mechanical Turk에서의 사용자 연구 결과, SB-GAN은 Cityscapes-25k에서 평균 품질 점수 2.61, ADE-Indoor에서 2.49를 기록하여 ProGAN과 BigGAN를 능가했다.
  • SB-GAN의 조건부 이미지 합성 하위 네트워크를 합성 레이블로 재학습하면, 초기 학습에서의 성능 대비 Cityscapes-5k에서 FID 점수 5.0% 향상되었다.
  • 절단 실험 결과, 전체 종단 간 재학습이 가장 우수한 성능(FID 58.67)을 기록했으며, 공동 재학습이 개별 구성 요소 재학습보다 우수했다.
  • SB-GAN이 생성한 합성 세분화 맵을 기반으로 SOTA 모델인 SPADE를 재학습시키면 성능 향상이 이루어져, 의미적 이미지 합성의 데이터 증강 수단으로서의 유용성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.