[논문 리뷰] Few-shot Semantic Image Synthesis Using StyleGAN Prior
이 논문은 한두 개의 애너테이션된 훈련 쌍만으로도 희박하거나 조밀한 의미적 레이아웃에서 고품질의 사진처럼 생긴 이미지를 생성하기 위해 사전 훈련된 StyleGAN 생성기의 사전 지식을 활용하는 소수 샘플 의미 이미지 합성 방법을 제안한다. 의미 클래스와 StyleGAN 특징 간의 최근접 이웃 특징 매칭을 통해 가짜 의미 마스크를 생성함으로써, 최소한의 레이블 데이터로도 생성기 제어를 위한 인코더를 훈련시키는 방법을 사용하며, 이로 인해 한 번 샘플 설정에서도 최신 기술 수준의 레이아웃 충실도와 시각적 품질을 달성한다.
This paper tackles a challenging problem of generating photorealistic images from semantic layouts in few-shot scenarios where annotated training pairs are hardly available but pixel-wise annotation is quite costly. We present a training strategy that performs pseudo labeling of semantic masks using the StyleGAN prior. Our key idea is to construct a simple mapping between the StyleGAN feature and each semantic class from a few examples of semantic masks. With such mappings, we can generate an unlimited number of pseudo semantic masks from random noise to train an encoder for controlling a pre-trained StyleGAN generator. Although the pseudo semantic masks might be too coarse for previous approaches that require pixel-aligned masks, our framework can synthesize high-quality images from not only dense semantic masks but also sparse inputs such as landmarks and scribbles. Qualitative and quantitative results with various datasets demonstrate improvement over previous approaches with respect to layout fidelity and visual quality in as few as one- or five-shot settings.
연구 동기 및 목표
- 소수의 애너테이션된 훈련 쌍만 존재할 때 의미 레이아웃에서 고품질의 사진처럼 생긴 이미지를 생성하는 문제를 해결한다.
- 픽셀 단위의 의미 마스크 애너테이션의 높은 비용을 줄이기 위해 비라벨 데이터와 사전 훈련된 StyleGAN을 활용한다.
- 희소 입력(예: 랜드마크, 스크래치)과 같은 조밀한 마스크 모두에서 소수 샘플 환경에서 의미 이미지 합성을 가능하게 한다.
- 복잡한 손실 함수와 하이퍼파라미터 튜닝을 피하기 위해 가짜 레이블된 데이터에 대한 단순한 L2 손실을 사용한다.
- 의미 레이아웃과 실제 이미지 사이의 도메인 갭을 줄이기 위해 의미 클래스에서 StyleGAN의 잠재 공간으로의 매핑을 학습한다.
제안 방법
- 대규모 비라벨 데이터셋(예: FFHQ, LSUN)에서 사전 훈련된 StyleGAN 생성기를 의미 특징 공간의 사전 지식으로 사용한다.
- 소수 샘플 애너테이션 예제의 각 의미 클래스에 대해 StyleGAN의 중간 레이어에서 평균 특징 벡터를 계산한다.
- 클래스 평균 특징과 가장 가까운 유사도를 가지는 잠재 공간의 랜덤 노이즈 벡터를 찾아가며 가짜 의미 마스크를 생성한다.
- 간단한 L2 손실을 사용하여, 랜덤 노이즈를 가짜 레이블된 의미 마스크와 일치하는 이미지를 생성하는 잠재 코드로 매핑하는 인코더 네트워크를 훈련시킨다.
- 훈련된 인코더를 고정된 StyleGAN 생성기와 통합하여 추론 시 의미 레이아웃을 통한 제어를 가능하게 한다.
- 조밀한 마스크와 희소 입력(예: 랜드마크, 스크래치)을 모두 의미 레이아웃 입력으로 간주하여 인코더에 통합한다.
실험 결과
연구 질문
- RQ1한두 개의 애너테이션된 훈련 쌍만으로도 소수 샘플 설정에서 높은 충실도의 의미 이미지 합성을 달성할 수 있는가?
- RQ2소수 샘플 설정에서 의미 이미지 합성에 필요한 애너테이션 데이터 부족을 보완하기 위해 사전 훈련된 StyleGAN 생성기를 효과적으로 활용할 수 있는가?
- RQ3StyleGAN의 잠재 공간에서 최근접 이웃 특징 매칭을 통해 생성된 가짜 레이블된 의미 마스크가 잠재적인 비일치가 있음에도 불구하고 고품질의 이미지 생성을 지원할 수 있는가?
- RQ4이러한 방법이 레이아웃이 조밀한 마스크보다 덜 정밀한 랜드마크나 스크래치와 같은 희소 입력 유형으로도 일반화 가능한가?
- RQ5기존의 픽셀 정렬된 및 비지도 이미지-이미지 번역 기법들과 비교했을 때, 소수 샘플 제약 조건 하에서 레이아웃 충실도와 시각적 품질 측면에서 이 방법은 어떻게 성능을 내는가?
주요 결과
- 1-shot 설정에서 LSUN ChurchMask에서 프레셰 인ception 거리(FID)가 65.1로, 동일한 수의 레이블 예제를 사용한 pSp(89.5)와 pix2pixHD++(100.6)를 모두 능가했다.
- CelebAMask-HQ에서 1-shot 설정에서 평균 교차율(mIoU)이 38.3을 기록하여, 동일한 훈련 데이터를 사용한 pSp(24.8)와 pix2pixHD++(38.7)를 크게 앞섰다.
- 전체 훈련 세트를 사용했을 때도 pSp(76.2)보다 낮은 FID(56.9)를 기록하여, 가짜 샘플링을 통한 StyleGAN의 잠재 공간 탐색이 더 효과적임을 보여주었다.
- 5-shot 설정에서 FID 점수는 CelebALandmark-HQ에서 82.1, LSUN ChurchMask에서 77.4로, 다양한 데이터셋에서 일관된 성능을 유지하며 모든 베이스라인을 능가했다.
- 희소 입력에 대한 강건성을 입증했다: 조밀한 마스크 감독 없이도 랜드마크와 스크래치에서 이미지를 성공적으로 생성했다.
- 1-shot 설정에서 CelebALandmark-HQ에서 랜드마크 정렬에 대한 RMSE가 31.5로, pSp(37.0)보다 낮아 레이아웃 충실도가 더 뛰어났다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.