[논문 리뷰] Towards Diverse and Faithful One-shot Adaption of Generative Adversarial Networks
이 논문은 하나의 참조 이미지만을 사용하여 사전 훈련된 GAN이 새로운 도메인에서 다양하고 고품질의 이미지를 생성할 수 있도록 하는 새로운 일회성 생성 도메인 적응 방법인 DiFa를 제안한다. CLIP 기반의 전반적 스타일 가이던스, 국소적 세부 사항 정렬을 위한 주의력 스타일 손실, 그리고 W+ 잠재 공간 내에서의 선택적 교차 도메인 일관성의 조합을 통해 DiFa는 다양성과 충실도 측면에서 최신 기술 수준을 달성하였으며, 특히 큰 도메인 갭이 존재할 경우 뛰어난 성능을 보였다.
One-shot generative domain adaption aims to transfer a pre-trained generator on one domain to a new domain using one reference image only. However, it remains very challenging for the adapted generator (i) to generate diverse images inherited from the pre-trained generator while (ii) faithfully acquiring the domain-specific attributes and styles of the reference image. In this paper, we present a novel one-shot generative domain adaption method, i.e., DiFa, for diverse generation and faithful adaptation. For global-level adaptation, we leverage the difference between the CLIP embedding of reference image and the mean embedding of source images to constrain the target generator. For local-level adaptation, we introduce an attentive style loss which aligns each intermediate token of adapted image with its corresponding token of the reference image. To facilitate diverse generation, selective cross-domain consistency is introduced to select and retain the domain-sharing attributes in the editing latent $\mathcal{W}+$ space to inherit the diversity of pre-trained generator. Extensive experiments show that our method outperforms the state-of-the-arts both quantitatively and qualitatively, especially for the cases of large domain gaps. Moreover, our DiFa can easily be extended to zero-shot generative domain adaption with appealing results. Code is available at https://github.com/1170300521/DiFa.
연구 동기 및 목표
- 하나의 참조 이미지만을 사용하여 사전 훈련된 GAN을 새로운 도메인에 적응시킬 때 다양하고 충실한 이미지를 생성하는 데 도전한다.
- 기존의 CLIP 기반 방법들이 국소적 스타일 세부 사항을 유지하지 못하고 불필요한 도메인 공유 속성 변화를 유도하는 한계를 극복한다.
- 사전 훈련된 생성기의 다양성을 유지하면서 참조 이미지로부터 도메인 특화된 속성과 스타일을 충실하게 습득한다.
- 참조 이미지 없이도 텍스트 기반의 목표 도메인 기술을 사용하여 효과적인 제로샷 도메인 적응을 가능하게 하기 위해 방법을 확장한다.
제안 방법
- 참조 이미지의 CLIP 임베딩과 소스 도메인 이미지의 평균 CLIP 임베딩 간의 차이를 활용하여 전반적 수준의 도메인 적응을 유도한다.
- 적응된 이미지의 중간 토큰과 참조 이미지의 CLIP 이미지 인코더 중간층에서 가장 가까운 대응 토큰을 정렬하는 주의력 스타일(AS) 손실을 도입한다.
- W+ 잠재 공간에서 선택적 교차 도메인 일관성(SCC)을 적용하여 이미지 생성 중에 도메인 공유 속성을 식별하고 유지함으로써 사전 훈련된 생성기의 다양성을 보존한다.
- StyleGAN 역인version 모델을 사용하여 소스 도메인 및 타겟 도메인 이미지를 W+ 공간으로 매핑함으로써 도메인 공유 속성 방향을 계산할 수 있도록 한다.
- 훈련 목표를 수정하여 도메인 공유 속성에서 적응된 이미지와 소스 이미지 간의 유사성을 유도하면서도 도메인 특화 속성에서의 다양성은 허용한다.
- 참조 이미지를 제거하고 CLIP 공간에서 텍스트 프롬프트를 타겟 도메인 기술로 사용함으로써 제로샷 GDA로 프레임워크를 확장한다.
실험 결과
연구 질문
- RQ1하나의 참조 이미지만을 사용하여 일회성 GAN 적응에서 높은 다양성과 충실도를 동시에 달성할 수 있는 방법은 무엇인가?
- RQ2CLIP 기반의 전반적 가이던스와 주의 기반의 국소적 스타일 정렬이 함께 적용될 경우 적응의 충실도는 어느 정도 향상되는가?
- RQ3W+ 공간에서 도메인 공유 속성을 선택적으로 유지함으로써 사전 훈련된 생성기의 다양성을 손상시키지 않고 유지할 수 있는가?
- RQ4참조 이미지가 없고 오직 목표 도메인의 텍스트 기술만 있는 제로샷 환경에서 제안된 방법의 효과성은 어떠한가?
- RQ5예를 들어 인간 얼굴에서 동물 조각상으로의 큰 도메인 갭에서도 이 방법은 잘 일반화되는가?
주요 결과
- DiFa는 FID, FID-100 등의 정량적 지표와 정성적 평가에서 모두 최신 기술 수준의 방법들을 능가하며, 고양이 → 호랑이와 같은 큰 도메인 갭에서도 특히 뛰어난 성능을 보였다.
- 주의력 스타일 손실은 국소적 속성의 충실도를 크게 향상시켜 참조 이미지의 미세한 세부 사항(예: 털 색상, 질감 등)을 충실하게 포착할 수 있도록 했다.
- 선택적 교차 도메인 일관성은 W+ 공간에서 도메인 공유 속성을 선택적으로 유지함으로써 사전 훈련된 생성기의 다양성을 성공적으로 보존하였다.
- 적응된 생성기는 소스 도메인에서의 편집 방향(예: 나이, 성별 등)을 성공적으로 타겟 도메인으로 이식할 수 있음을 보여주며 강력한 잠재 공간 편집 능력을 유지하였다.
- 참조 이미지가 없는 제로샷 GDA 환경에서도 이 방법은 FFHQ에서 '검은 연필로 그린 스케치'와 같은 텍스트 기반 도메인으로의 적응에서 StyleGAN-NADA보다 더 일관되고 다양한 결과를 생성함으로써 효과적인 일반화를 보였다.
- 제거 실험을 통해 AS 손실과 SCC 손실 둘 다 높은 성능을 달성하는 데 필수적임을 확인하였으며, 둘 중 하나를 제거하면 FID와 시각적 품질이 심각하게 떨어졌다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.