[논문 리뷰] Domain Re-Modulation for Few-Shot Generative Domain Adaptation
이 논문은 소수의 샘플로 생성하는 도메인 적응을 위한 새로운 생성자 아키텍처인 도메인 재조정(DoRM)을 제안한다. DoRM은 사전 훈련된 소스 생성자를 동결하고, 학습 가능한 매핑 및 애핀 모듈(M&A)을 도입하여 고해상도, 다양한, 도메인 간 일관성 있는 이미지 합성을 가능하게 한다. StyleGAN의 스타일 공간에서 선형 조합 가능성을 활용함으로써 DoRM은 다중 도메인 및 하이브리드 도메인 생성을 지원하며, 유사도 기반의 구조 손실을 통해 도메인 간 일관성을 향상시켜 10-shot GDA에서 최신 기술 수준의 성능을 달성한다.
In this study, we delve into the task of few-shot Generative Domain Adaptation (GDA), which involves transferring a pre-trained generator from one domain to a new domain using only a few reference images. Inspired by the way human brains acquire knowledge in new domains, we present an innovative generator structure called Domain Re-Modulation (DoRM). DoRM not only meets the criteria of high quality, large synthesis diversity, and cross-domain consistency, which were achieved by previous research in GDA, but also incorporates memory and domain association, akin to how human brains operate. Specifically, DoRM freezes the source generator and introduces new mapping and affine modules (M&A modules) to capture the attributes of the target domain during GDA. This process resembles the formation of new synapses in human brains. Consequently, a linearly combinable domain shift occurs in the style space. By incorporating multiple new M&A modules, the generator gains the capability to perform high-fidelity multi-domain and hybrid-domain generation. Moreover, to maintain cross-domain consistency more effectively, we introduce a similarity-based structure loss. This loss aligns the auto-correlation map of the target image with its corresponding auto-correlation map of the source image during training. Through extensive experiments, we demonstrate the superior performance of our DoRM and similarity-based structure loss in few-shot GDA, both quantitatively and qualitatively. The code will be available at https://github.com/wuyi2020/DoRM.
연구 동기 및 목표
- 기존의 전체 생성자를 재학습하는 소수의 GAN 적응 방법이 다중 도메인 및 하이브리드 도메인 생성을 제한하는 한계를 해결하기 위해.
- 단지 몇 장의 참조 이미지만으로도 새로운 도메인에서 효율적이고 고해상도의 이미지 합성을 가능하게 하기 위해.
- 인간의 뇌 학습 메커니즘을 모방하여 생성자에 기억력과 도메인 연관 능력을 부여하기 위해.
- 유사도 기반의 새로운 구조 손실을 통해 소스 이미지와 적응된 타겟 이미지 간의 도메인 간 일관성을 향상시키기 위해.
제안 방법
- DoRM는 사전 훈련된 소스 생성자를 동결하면서도 엔드 투 엔드로 훈련 가능한 새로운 매핑 및 애핀 모듈(M&A)을 도입하여 도메인 특화 스타일 조정을 가능하게 한다.
- M&A 모듈은 스타일 공간에서 선형 조합 가능한 도메인 이동을 유도하도록 훈련되어, 동시에 여러 모듈을 활성화함으로써 다중 도메인 및 하이브리드 도메인 생성을 가능하게 한다.
- 유사도 기반의 구조 손실 $L_{ss}$ 가 제안되며, 이는 소스 및 타겟 이미지의 중간 CLIP 특징의 자기상관 맵을 정렬하여 도메인 간 일관성을 향상시킨다.
- 이 방법은 CLIP의 이미지 인코더를 활용하여 중간 토큰을 추출하고, 손실 감독을 위해 자기상관 맵을 계산한다.
- 생성자 아키텍처는 각 타겟 도메인에 대해 M&A 모듈를 선택적으로 활성화할 수 있도록 설계되어 있어, 효율적인 저장 및 추론을 가능하게 한다.
- 이 방법은 2D(StyleGAN2) 및 3D(EG3D) GAN 모두에서 평가되어 아키텍처 간 일반화 능력을 입증한다.

실험 결과
연구 질문
- RQ1소수의 GAN 적응 방법이 다중 도메인 및 하이브리드 도메인 생성을 지원하면서도 고해상도, 다양한, 일관성 있는 이미지 합성을 달성할 수 있는가?
- RQ2생성자는 이전에 학습한 도메인의 지식을 유지하고 이를 새로운 하이브리드 도메인 합성에 통합할 수 있는가?
- RQ3학습 가능한 모듈식 적응 메커니즘이 전체 생성자 미세조정에 비해 효율성, 일관성, 일반화 능력 측면에서 뛰어나게 성능을 낼 수 있는가?
- RQ4유사도 기반의 구조 손실이 소수의 GAN 적응에서 도메인 간 정렬을 얼마나 향상시키는가?
- RQ5제안된 방법은 3D GAN을 포함한 다양한 GAN 아키텍처로 일반화될 수 있는가?
주요 결과
- 10-shot GDA에서 DoRM는 스케치 도메인과의 CLIP 특징 코사인 유사도가 0.9492로, 모든 베이스라인을 초월했으며, 베이비스 도메인과는 0.9780의 유사도를 기록했다.
- 하이브리드 도메인 생성(예: 스케치-베이비스)에서 DoRM는 CLIP 유사도 0.8809/0.7271을 기록하여, 도메인 확장 및 DynaGAN과 같은 기존 방법보다 뚜렷하게 뛰어난 성능을 보였다.
- DoRM는 소스 이미지와 적응된 타겟 이미지 간의 정체성 및 자세 일관성을 유지하며 도메인 간 우수한 일관성을 확보했다.
- 메서드는 여러 적응된 도메인 간에 부드러운 잠재 공간 보간 및 편집을 가능하게 하여 점진적이고 의미적으로 유의미한 스타일 전이를 확인했다.
- EG3D에서 1-shot GDA를 수행한 결과, DoRM는 스케치 도메인에서 고해상도 이미지를 성공적으로 생성하면서도 소스 정체성을 유지했다.
- 정성적 결과는 DoRM가 표준 도메인과 하이브리드 도메인 모두에서 현실적이고 다양한, 일관성 있는 이미지를 생성할 수 있음을 확인했으며, 하이브리드 생성에서 실패 사례가 관찰되지 않았다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.