[논문 리뷰] Diverse Semantic Image Synthesis via Probability Distribution Modeling
이 논문은 클래스별 조절 파라미터를 연속 확률 분포로 모델링하여 인스턴스 수준 및 의미 수준의 다양성을 가능하게 하는 새로운 프레임워크인 INADE를 제안한다. 인스턴스 적응형 스토케스틱 샘플링과 사전 노이즈 리맵핑을 통해 INADE는 비교적 높은 이미지 품질을 유지하면서도 최신 기술을 초월하는 다양성을 달성한다. 다양한 데이터셋에서 정량적 지표와 정성적 결과 모두에서 기존 방법들을 능가한다.
Semantic image synthesis, translating semantic layouts to photo-realistic images, is a one-to-many mapping problem. Though impressive progress has been recently made, diverse semantic synthesis that can efficiently produce semantic-level multimodal results, still remains a challenge. In this paper, we propose a novel diverse semantic image synthesis framework from the perspective of semantic class distributions, which naturally supports diverse generation at semantic or even instance level. We achieve this by modeling class-level conditional modulation parameters as continuous probability distributions instead of discrete values, and sampling per-instance modulation parameters through instance-adaptive stochastic sampling that is consistent across the network. Moreover, we propose prior noise remapping, through linear perturbation parameters encoded from paired references, to facilitate supervised training and exemplar-based instance style control at test time. Extensive experiments on multiple datasets show that our method can achieve superior diversity and comparable quality compared to state-of-the-art methods. Code will be available at \url{https://github.com/tzt101/INADE.git}
연구 동기 및 목표
- 의미 레이아웃에서부터 다양하고 고해상도의 사진처럼 생긴 이미지를 생성하는 데 도전하는 것, 특히 인스턴스 수준에서의 도전에 초점한다.
- 기존 방법들이 전역 또는 의미 수준의 다양성만 지원하거나 높은 계산 비용을 야기한다는 한계를 극복하는 것.
- 연속적인 확률 분포를 통한 조절 파라미터 모델링을 통해 세밀하고 제어 가능한 다양성을 가능하게 하는 것.
- 추론 시 참조 기반 스타일 제어를 가능하게 하기 위해 사전 노이즈 리맵핑을 통한 테스트 타임 참조 기반 스타일 제어를 지원하는 것.
제안 방법
- 고정된 값이 아닌 연속적인 확률 분포로 클래스별 조건부 정규화 파라미터를 표현하는 변동형 조절 모델을 제안한다.
- 일관된 랜덤성과 학습 가능한 변환을 통해 네트워크 전반에서 일관되고 공명하는 스토케스틱 샘플링을 위한 인스턴스 적응형 스토케스틱 샘플링을 도입한다.
- 쌍체 참조 이미지에서 인코딩된 선형 편향 파라미터를 사용해 사전 노이즈 리맵핑을 수행함으로써 지도 학습을 향상시키고 추론 시 참조 기반 스타일 제어를 가능하게 한다.
- 인스턴스 인식 정규화를 통합한 조건부 GAN 프레임워크에 이 방법을 통합하여, INADE(인스턴스 적응형 DE 정규화)로 명명한다.
- 각 정규화 레이어마다 학습 가능한 변환을 통해 스토케스틱 샘플링을 네트워크 전반에서 정렬하고 안정적인 생성을 보장한다.
- 쌍체 참조를 활용해 편향 파라미터를 인코딩하여 노이즈 샘플을 리맵핑함으로써 추론 시 예시 기반 스타일 전이를 가능하게 한다.
실험 결과
연구 질문
- RQ1조절 파라미터를 연속적인 확률 분포로 모델링하는 것이 인스턴스 수준에서 더 민첩하고 다양한 이미지 합성을 가능하게 할 수 있는가?
- RQ2깊은 네트워크 전반에서 일관되고 공명하는 스토케스틱 샘플링을 어떻게 달성할 수 있는가? 이는 이미지 품질을 유지하면서 다양성을 확보하는 데 기여한다.
- RQ3참조 이미지에서 유도된 사전 노이즈 리맵핑이 학습 효율성을 향상시키고, 추가적인 추론 브랜치 없이도 테스트 타임 스타일 제어를 가능하게 할 수 있는가?
- RQ4복잡한 데이터셋에서 기존 최신 기술 대비 다양성, 품질, 계산 효율성 측면에서 제안된 방법의 성능은 어떠한가?
- RQ5이 방법이 복잡한 시나리오에서 의미 수준과 인스턴스 수준의 다중 모달 생성을 어느 정도 지원할 수 있는가?
주요 결과
- INEA는 Cityscapes, ADE20K, CelebAMask-HQ, DeepFashion 데이터셋에서 다양성과 품질 측면에서 최고의 종합 성능을 기록하며, 모든 지표에서 최신 기술을 능가한다.
- Cityscapes와 ADE20K에서 INADE는 FID와 LPIPS 측면에서 GroupDNet을 크게 앞서며, 추론 시간은 59%에서 79% 감소하고, FLOPs는 82%에서 89% 감소한다.
- 절단 실험 결과, 인스턴스 수준 샘플링(US)을 제거하면 방법이 실패하고, 사전 노이즈 리맵핑(PNR)을 제거하면 이미지 품질에 심각한 저하가 발생함을 확인했다.
- 정성적 결과에서는 INADE가 BicycleGAN, DSCGAN, VSPADE, GroupDNet보다 더 현실적이고 다양한 이미지를 생성함을 보여주며, 특히 다수의 상호작용하는 인스턴스가 포함된 복잡한 시나리오에서 뛰어난 성능을 발휘한다.
- 이 방법은 의미 수준과 인스턴스 수준의 편집을 모두 지원하며, 특정 객체(예: 헤어스타일, 상의, 바지)에 대해 참조 기반 외관 전이를 가능하게 한다.
- INEA에서는 추가 참조 입력을 사용하는 기존 최신 기술들조차도 FID 점수 수준에서 비슷하거나 뛰어난 고해상도 생성 품질을 유지하면서 세밀한 제어를 가능하게 한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.