Skip to main content
QUICK REVIEW

[논문 리뷰] Mind the Gap: Domain Gap Control for Single Shot Domain Adaptation for Generative Adversarial Networks

Peihao Zhu, Rameen Abdal|arXiv (Cornell University)|2021. 10. 15.
Generative Adversarial Networks and Image Synthesis참고 문헌 38인용 수 16
한 줄 요약

이 논문은 단일 샘플 도메인 적응을 위한 새로운 GAN 방법을 제안하며, II2S 역변환과 새로운 정규화 항식을 사용하여 정체성과 콘텐츠를 유지하면서 세분화된 속성 제어를 가능하게 하고, 참조 이미지에서 도메인 B의 CLIP 임베딩 벡터를 도메인 A의 의미적 유사체로 모델링함으로써 시각적 품질을 향상시키고 과적합을 줄인다.

ABSTRACT

We present a new method for one shot domain adaptation. The input to our method is trained GAN that can produce images in domain A and a single reference image I_B from domain B. The proposed algorithm can translate any output of the trained GAN from domain A to domain B. There are two main advantages of our method compared to the current state of the art: First, our solution achieves higher visual quality, e.g. by noticeably reducing overfitting. Second, our solution allows for more degrees of freedom to control the domain gap, i.e. what aspects of image I_B are used to define the domain B. Technically, we realize the new method by building on a pre-trained StyleGAN generator as GAN and a pre-trained CLIP model for representing the domain gap. We propose several new regularizers for controlling the domain gap to optimize the weights of the pre-trained StyleGAN generator to output images in domain B instead of domain A. The regularizers prevent the optimization from taking on too many attributes of the single reference image. Our results show significant visual improvements over the state of the art as well as multiple applications that highlight improved control.

연구 동기 및 목표

  • 기존 방법이 참조 이미지를 과도하게 모방함에 따라 발생하는 과적합과 모드 붕괴 문제를 해결한다.
  • 단일 참조 이미지를 사용하여 도메인 A에서 도메인 B로의 번역 이미지에서 시각적 정밀도와 정체성 유지 수준을 향상시킨다.
  • 도메인 간의 차이를 더 정밀하게 모델링하여 어떤 속성이 이전 도메인에서 새 도메인으로 전달될지 세분화된 제어를 가능하게 한다.
  • 잠재 공간의 구조를 유지함으로써 기존 이미지 편집 프레임워크(예: StyleFlow)와의 호환성을 확보한다.
  • 단일 GPU에서 수분 내로 실행되는 계산 효율적인 방법을 개발하여 실용적 구현을 가능하게 한다.

제안 방법

  • 도메인 A의 기본 생성기로 사전 훈련된 StyleGAN2 생성기를 사용하고, 이를 도메인 B의 이미지를 생성하도록 미세조정한다.
  • CLIP를 활용하여 도메인 B의 참조 이미지와 도메인 A의 해당 이미지를 공통된 의미 공간에 임bed한다.
  • 도메인 A의 평균에서가 아니라 도메인 B의 참조 이미지에서 그 의미적 유사체에 이르는 벡터로 도메인 간 격차를 모델링함으로써 과적합을 줄인다.
  • II2S 역변환을 적용하여 도메인 B의 참조 이미지를 도메인 A로 다시 전이함으로써 도메인 간 격차를 더 정확히 추정할 수 있는 고품질의 유사 이미지를 생성한다.
  • 새로운 정규화 항식인 $L_{\text{ref\_clip}}$, $L_{\text{clip\_within}}$을 도입하여 최적화 과정에서 참조 이미지의 속성 수용 비율을 제어한다.
  • 개선된 레이어 선택 전략과 스타일 믹싱을 사용하여 생성된 이미지의 다양성과 현실감을 향상시킨다.

실험 결과

연구 질문

  • RQ1기존의 도메인 A 평균에서부터의 벡터가 아니라, 참조 이미지에서 그 도메인 A 유사체로의 벡터로 도메인 간 격차를 재정의함으로써 단일 샘플 도메인 적응에서 과적합을 줄일 수 있는가?
  • RQ2단일 참조 이미지를 사용하여 스타일을 새로운 도메인으로 전이할 때, 소스 도메인 이미지의 정체성과 콘텐츠를 얼마나 잘 유지할 수 있는가?
  • RQ3간단한 평균 기반 벡터와 비교해 볼 때, II2S 역변환을 사용함으로써 도메인 간 격차 추정의 품질과 의미 일관성이 얼마나 향상되는가?
  • RQ4편집 모델을 재학습하지 않고도 타겟 도메인에서 속성 전이(예: 자세, 조명, 표정)에 대해 세분화된 제어를 달성할 수 있는가?
  • RQ5새로운 정규화 항식이 단일 샘플 GAN 적응에서 시각적 품질과 모드 붕괴에 미치는 영향은 어떠한가?

주요 결과

  • 사용자 선호도 조사에서 본 방법은 StyleGAN-NADA 대비 73%, 소수 샘플 기반 기준 대비 77%로 시각적 품질에서 유의미한 향상을 보였다.
  • 사용자 80%가 본 방법이 도메인 A의 소스 이미지 유사도를 더 잘 유지한다고 평가하여 과적합 감소와 더 나은 정체성 유지가 확인되었다.
  • 사용자 91%가 본 방법이 소스 이미지 유사도 유지에서 우수하다고 선택하여 경쟁 방법 대비 모드 붕괴 감소가 뚜렷하게 나타났다.
  • 절단 실험 결과, II2S를 활용한 유사 이미지 생성과 $L_{\text{ref\_clip}}$, $L_{\text{clip\_within}}$ 정규화 항식 적용이 재구성 및 스타일 전이 품질을 크게 향상시킨다.
  • StyleFlow를 사용한 도메인 B 내 이미지 편집이 완전히 호환됨을 통해 적응 후에도 의미적 속성과 잠재 공간의 구조가 유지됨을 입증하였다.
  • 단일 GPU에서 수분 내로 실행되어 복잡한 단일 샘플 도메인 적응임에도 불구하고 실용적 응용에 적합함을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.