[논문 리뷰] SemanticStyleGAN: Learning Compositional Generative Priors for Controllable Image Synthesis and Editing
SemanticStyleGAN은 지역적 의미 부분(예: 눈, 머리카락, 입 등)을 전용 잠재 코드로 모델링함으로써 잠재 공간을 분리하는 구성적 GAN 아키텍처를 소개한다. 이는 구조와 텍스처에 대한 미세 조절을 가능하게 하며, 이미지와 세그멘테이션 마스크를 함께 훈련시음으로써 우수한 분리도를 달성하고 기존의 StyleGAN 기반 방법과 결합할 때 더 정밀한 편집을 가능하게 한다.
Recent studies have shown that StyleGANs provide promising prior models for downstream tasks on image synthesis and editing. However, since the latent codes of StyleGANs are designed to control global styles, it is hard to achieve a fine-grained control over synthesized images. We present SemanticStyleGAN, where a generator is trained to model local semantic parts separately and synthesizes images in a compositional way. The structure and texture of different local parts are controlled by corresponding latent codes. Experimental results demonstrate that our model provides a strong disentanglement between different spatial areas. When combined with editing methods designed for StyleGANs, it can achieve a more fine-grained control to edit synthesized or real images. The model can also be extended to other domains via transfer learning. Thus, as a generic prior model with built-in disentanglement, it could facilitate the development of GAN-based applications and enable more potential downstream tasks.
연구 동기 및 목표
- StyleGAN에서 전역 잠재 코드가 전체 이미지에 영향을 주는 바탕으로, 이로 인한 미세 조절의 부족을 해결하기 위해.
- 전역 간섭 없이 지역적 의미 영역(예: 눈, 머리카락 등)을 분리된 방식으로 조작할 수 있는 생성 사전을 개발하기 위해.
- 초기 사전 훈련 시 세그멘테이션 마스크를 사용한 후, 이미지 데이터만으로도 새로운 도메인(예: 패션, 만화)에 대한 전이 학습을 가능하게 하기 위해.
- 기존의 StyleGAN 기반 편집 방법과 통합하여 더 향상된 국소적 이미지 편집 능력을 제공하기 위해.
제안 방법
- 생성자는 세그멘테이션 마스크로 정의된 각 의미 부분을 담당하는 지역 생성자 집합을 사용한다.
- 각 지역 생성자는 해당 부분의 형태와 텍스처를 제어하는 전용 잠재 코드에 조건을 부여한다.
- 지역 생성자에서 생성된 특징들은 마스크 기반 융합을 통해 최종 이미지를 합성한다.
- 이미지 복원과 의미 세그멘테이션 마스크 일致성 양측을 모델링하는 통합 목표함수를 사용해 엔드 투 엔드로 모델을 훈련시킨다.
- 각 의미 영역별로 특징 조절을 분리함으로써 공간적 분리도를 강제함으로써 교차 영역 간 간섭을 감소시킨다.
- 이미지 전용 데이터셋에서 미세 조정함으로써 전이 학습을 지원하며, 지역 분리도를 유지한다.

실험 결과
연구 질문
- RQ1고품질의 이미지를 유지하면서도 잠재 공간에서 지역적 의미 부분을 분리할 수 있는 GAN을 훈련시킬 수 있는가?
- RQ2지역 잠재 코드가 전역 StyleGAN 제어보다 특정 이미지 영역에 더 정밀한 편집을 가능하게 하는가?
- RQ3세그멘테이션 마스크 없이도 새로운 도메인의 이미지 전용 데이터셋에서 효과적으로 미세 조정될 수 있는가, 그리고 공간적 분리도를 유지하는가?
- RQ4기존의 StyleGAN 편집 방법과의 통합이 더 나은 제어성을 위해 얼마나 잘 작동하는가?
- RQ5패션이나 만화 이미지와 같은 비얼굴 도메인으로의 일반화 능력은 어느 정도인가?
주요 결과
- SemanticStyleGAN은 공간적 영역 간 강력한 분리도를 달성하여 지역적 부분의 구조와 텍스처를 독립적으로 제어할 수 있다.
- 최적화 기반 편집(예: StyleCLIP)과 결합할 경우, 사용자가 지정한 영역을 존중하는 충실도 높은 국소적 편집이 가능하다.
- Toonify, MetFaces, BitMoji와 같은 이미지 전용 데이터셋에서의 미세 조정 후에도 모델은 지역 분리도를 유지한다. 이는 미세 조정 중 세그멘테이션 마스크가 사용되지 않았음에도 불구하고 성립한다.
- 모델은 패션과 같은 비얼굴 도메인으로도 성공적으로 일반화되며, 의미 부분 별로 다양한 의류 스타일을 제어 가능하게 한다.
- 정성 있는 결과를 통해 전반적인 품질은 유지하면서도 전반적인 아티팩트 없이 정확하고 국소적인 변화를 구현함으로써, 더 향상된 편집 가능성과 함께 고품질의 이미지 합성을 가능하게 한다.
- 특히 머리카락 스타일이나 얼굴 특징 같은 속성을 편집할 때 전반적인 의도하지 않은 변화가 최소화되는 국소 편집 작업에서 표준 StyleGAN을 능가한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.