Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Layout and Style Reconfigurable GANs for Controllable Image Synthesis

Wei Sun, Tianfu Wu|arXiv (Cornell University)|2020. 03. 25.
Generative Adversarial Networks and Image Synthesis참고 문헌 64인용 수 19
한 줄 요약

이 논문은 재구성 가능한 레이아웃과 스타일 코드로부터 제어 가능한 이미지 합성을 위한 GAN 기반 프레임워크인 LostGAN을 제안한다. 새로운 레이아웃-마스크-이미지 파이프라인을 통해 구현되며, 개체별로 민감하고 레이아웃을 고려하는 정규화(이하 ISLA-Norm)를 도입하여 세분화된, 약한 지도 학습 기반의 마스크 생성과 이미지 수준 및 개체 수준의 스타일 및 레이아웃에 대한 강력한 제어를 가능하게 한다. 학습 과정에서 진짜 마스크가 필요하지 않아 COCO-Stuff 및 Visual Genome 데이터셋에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

With the remarkable recent progress on learning deep generative models, it becomes increasingly interesting to develop models for controllable image synthesis from reconfigurable inputs. This paper focuses on a recent emerged task, layout-to-image, to learn generative models that are capable of synthesizing photo-realistic images from spatial layout (i.e., object bounding boxes configured in an image lattice) and style (i.e., structural and appearance variations encoded by latent vectors). This paper first proposes an intuitive paradigm for the task, layout-to-mask-to-image, to learn to unfold object masks of given bounding boxes in an input layout to bridge the gap between the input layout and synthesized images. Then, this paper presents a method built on Generative Adversarial Networks for the proposed layout-to-mask-to-image with style control at both image and mask levels. Object masks are learned from the input layout and iteratively refined along stages in the generator network. Style control at the image level is the same as in vanilla GANs, while style control at the object mask level is realized by a proposed novel feature normalization scheme, Instance-Sensitive and Layout-Aware Normalization. In experiments, the proposed method is tested in the COCO-Stuff dataset and the Visual Genome dataset with state-of-the-art performance obtained.

연구 동기 및 목표

  • 재구성 가능한 공간적 레이아웃과 스타일 코드로부터 제어 가능한 이미지 합성을 해결함으로써, 시각적 이해를 위한 체계적인 분석-통합 기반 접근을 가능하게 한다.
  • 학습 과정에서 진짜 세그먼테이션 마스크가 필요 없이 레이아웃에서 개체 마스크를 학습하는 약한 지도 학습 방법을 개발하여 Visual Genome와 같은 데이터셋에 대한 적용 가능성을 높인다.
  • 생성된 이미지의 이미지 수준 및 개체 수준의 스타일과 레이아웃 변화에 대해 세분화된 제어를 달성한다.
  • 개체 인스턴스와 레이아웃 구조에 민감한 새로운 정규화 기법을 설계하여 조건부 이미지 생성에서 특징 표현을 향상시킨다.
  • COCO-Stuff 및 Visual Genome 데이터셋에서 레이아웃-이미지 합성 작업에서 최신 기술 수준의 성능을 달성하면서도 강력한 제어력을 유지한다.

제안 방법

  • 이 방법은 레이아웃-마스크-이미지 파이프라인을 활용하며, 입력 레이아웃과 스타일 코드로부터 약한 지도 학습 기반으로 개체 마스크를 예측한 후 이미지 생성을 수행한다.
  • 개체 수준의 특징과 공간적 레이아웃 구조에 적응하기 위해, 개체별 민감하고 레이아웃을 고려하는 정규화(ISLA-Norm) 레이어를 도입하여 더 나은 특징 조절을 가능하게 한다.
  • 생성망 네트워크는 ISLA-Norm를 여러 레이어에 걸쳐 통합하여, 개체 정체성과 공간 구성에 따라 동적으로 특징을 적응시킬 수 있도록 한다.
  • 고품질의 이미지 합성을 보장하기 위해 적대적 손실과 인지적 손실을 포함한 GAN 프레임워크를 사용하여 엔드 투 엔드로 모델을 훈련시킨다.
  • 예측된 마스크의 품질과 공간 일관성을 향상시키기 위해, 저해상도에서 고해상도로 점진적으로 마스크를 개선하는 반복적 마스크 정밀화 모듈을 사용한다.
  • 성능 저하 없이 비지도 학습 데이터를 활용하여 일반화 능력을 향상시키는 반도금의 레이아웃 버전을 개발하였다.

실험 결과

연구 질문

  • RQ1진짜 마스크가 필요 없이 약한 지도 학습 기반의 레이아웃-마스크-이미지 파이프라인이 이미지 합성에서 강력한 제어력을 달성할 수 있는가?
  • RQ2ISLA-Norm는 개체 외관과 레이아웃 구조에 대해 분리된, 인스턴스 수준의 제어를 얼마나 효과적으로 가능하게 하는가?
  • RQ3레이아웃 재구성, 예를 들어 새로운 개체를 추가하거나 변형할 경우, 스타일 일관성이 얼마나 유지되는가?
  • RQ4단일 단계 마스크 예측 대비 반복적 마스크 정밀화 과정이 마스크 및 이미지 품질을 얼마나 크게 향상시키는가?
  • RQ5Visual Genome와 같이 마스크 애너테이션 없이도 모델이 일반화되어 최신 기술 수준의 성능을 유지할 수 있는가?

주요 결과

  • 제안된 LostGAN은 256×256 해상도에서 COCO-Stuff 데이터셋에서 최신 기술 수준의 Inception Score(81.4)와 Fréchet Inception Distance(FID)(15.7)를 달성한다.
  • Visual Genome 데이터셋에서 LostGAN은 FID 25.3을 기록하여, 학습 과정에서 진짜 마스크가 필요한 Grid2Im를 포함한 이전 방법들을 초월한다.
  • 제거 실험 결과, 마스크 정밀화 단계를 제거하면 성능이 저하되나, 첫 번째 정밀화 단계($m_1$)를 제거해도 성능 향상이 없음을 확인하여, 저해상도 출력이 최적화되지 않았음을 시사한다.
  • 모델은 강력한 스타일 제어력을 보여주며, 단일 개체(예: 사람)의 스타일 코드만 변경해도 레이아웃과 다른 개체의 스타일을 유지하면서 다양한 외형을 생성한다.
  • 레이아웃 변경 동안에도 개체 스타일을 효과적으로 유지한다. 예를 들어, 눈 지역의 스타일은 산이나 나무와 같은 새로운 개체가 추가되어도 일관성을 유지하며, 이 부분에서 Grid2Im를 능가한다.
  • 실패 사례 분석을 통해 세부적인 개체 상호작용(예: 사람과 테니스 라켓 간의 관계)을 모델링하는 데 한계를 보이며, 향후 연구에서는 파트 수준의 마스크 감시가 필요할 것으로 판단된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.