Skip to main content
QUICK REVIEW

[논문 리뷰] Image Synthesis From Reconfigurable Layout and Style

Wei Sun, Tianfu Wu|arXiv (Cornell University)|2019. 08. 20.
Generative Adversarial Networks and Image Synthesis참고 문헌 38인용 수 7
한 줄 요약

이 논문은 재구성 가능한 레이아웃(클래스 레이블이 부여된 경계 상자)과 분리된 스타일 잠복 코드에서 고해상도(최대 128×128) 이미지를 생성하는 생성적 적대적 네트워크인 LostGANs를 제안한다. 일관되고 다양한 이미지 생성을 위해 레이아웃 변형과 스타일 변동에 적응 가능하게 하기 위해 약한 지도 학습 기반 마스크 학습과 개체별 레이아웃 인식 정규화(ISLA-Norm)를 도입하여 COCO-Stuff 및 Visual Genome 데이터셋에서 최신 기준 성능을 달성한다.

ABSTRACT

Despite remarkable recent progress on both unconditional and conditional image synthesis, it remains a long-standing problem to learn generative models that are capable of synthesizing realistic and sharp images from reconfigurable spatial layout (i.e., bounding boxes + class labels in an image lattice) and style (i.e., structural and appearance variations encoded by latent vectors), especially at high resolution. By reconfigurable, it means that a model can preserve the intrinsic one-to-many mapping from a given layout to multiple plausible images with different styles, and is adaptive with respect to perturbations of a layout and style latent code. In this paper, we present a layout- and style-based architecture for generative adversarial networks (termed LostGANs) that can be trained end-to-end to generate images from reconfigurable layout and style. Inspired by the vanilla StyleGAN, the proposed LostGAN consists of two new components: (i) learning fine-grained mask maps in a weakly-supervised manner to bridge the gap between layouts and images, and (ii) learning object instance-specific layout-aware feature normalization (ISLA-Norm) in the generator to realize multi-object style generation. In experiments, the proposed method is tested on the COCO-Stuff dataset and the Visual Genome dataset with state-of-the-art performance obtained. The code and pretrained models are available at \url{https://github.com/iVMCL/LostGANs}.

연구 동기 및 목표

  • 재구성 가능한 레이아웃과 스타일에서 현실적이며 고해상도 이미지를 생성하는 데 도전하며, 일대다 매핑을 유지하고 레이아웃/스타일 변형에 적응 가능하도록 하는 것.
  • 기존의 레이아웃에서 이미지 생성 모델이 저해상도(예: 64×64)에 국한되고 스타일 다양성이 부족한 데 개선하는 것.
  • 공간 일관성과 개체 정체성을 유지하면서도 레이아웃 변경에 대해 개체 수준의 세밀한 스타일 제어를 가능하게 하는 것.
  • 정답 세그멘테이션 마스크가 필요 없이 약한 지도 학습 방식으로 의미적 마스크 맵을 학습하는 것.
  • 이미지 품질, 다양성, 레이아웃 일관성을 동시에 최적화하는 GAN의 엔드 투 엔드 학습을 달성하는 것.

제안 방법

  • 개체 인스턴스별로 레이아웃 인식 특징 정규화(ISLA-Norm)를 적용한 ResNet 기반의 새로운 생성자 아키텍처를 도입하여 개체별 스타일 제어를 가능하게 한다.
  • 정답 마스크가 없는 상태에서 어텐션 기반 마스크 가중치를 사용해 레이아웃 입력과 이미지 출력 사이를 연결함으로써 세분화된 마스크 맵을 약한 지도 학습 방식으로 학습한다.
  • 생성자 기반 GAN 프레임워크를 사용하며, 디스커미네이터도 ResNet 기반으로 구성하여 현실성과 레이아웃 일관성을 강제로 학습한다.
  • 잠재 스타일 코드를 활용해 외관과 구조를 제어함으로써 동일한 레이아웃에서 다양한 이미지 생성을 가능하게 한다.
  • 128×128 고해상도 생성을 안정화하고 향상시키기 위해 다중 척도 학습 전략을 적용한다.
  • 이미지 정밀도와 세부 사항을 최적화하기 위해 적대적 손실, 인지 손실, L1 손실의 조합을 사용한다.

실험 결과

연구 질문

  • RQ1GAN 기반 모델이 재구성 가능한 레이아웃과 분리된 스타일 코드에서 일대다 매핑을 유지하면서도 고해상도(128×128) 이미지를 생성할 수 있는가?
  • RQ2정답 세그멘테이션 마스크가 없이도 경계 상자 레이아웃에서 의미 있는 의미적 마스크 맵을 학습할 수 있는가?
  • RQ3레이아웃이 변형되었을 때(예: 경계 상자를 추가하거나 이동시켰을 때) 모델이 개체 정체성과 공간 일관성을 유지할 수 있는가?
  • RQ4모델이 개체 수준의 스타일 제어를 얼마나 잘 달성할 수 있는가? 즉, 개체 외관을 독립적으로 조작할 수 있는가?
  • RQ5제안된 ISLA-Norm 레이어가 시각적 품질과 다양성을 향상시키며 다중 객체 스타일 생성을 효과적으로 가능하게 하는가?

주요 결과

  • LostGAN은 64×64 해상도에서 COCO-Stuff 데이터셋에서 인ception 스코어 28.81과 FID 15.6을 기록하여 이전 최고 성능인 Layout2Im를 초월했다.
  • 128×128 해상도에서도 강력한 성능을 유지하여 인ception 스코어 28.70과 FID 16.2를 기록하여 고해상도 확장성 잠재력을 입증했다.
  • Layout2Im 대비 다양성 스코어가 크게 향상되어 스타일 다양성 향상과 효과적인 일대다 매핑이 입증되었다.
  • 분류 정확도 스코어(CAS)는 COCO-Stuff에서 28.70, Visual Genome에서 25.89를 기록하여 객체 인식에 대한 더 나은 일반화 능력을 보였다.
  • 정성적 결과는 LostGAN이 이전 방법보다 더 현실적이며 의미적으로 일관된 이미지를 생성함을 확인했으며, 특히 레이아웃 변형 상황에서 뛰어난 성능을 보였다.
  • 제거 실험 결과, ISLA-Norm와 약한 지도 학습 기반 마스크 학습이 레이아웃 일관성과 스타일 제어 향상에 뚜렷한 기여를 했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.