Skip to main content
QUICK REVIEW

[논문 리뷰] Generalized One-shot Domain Adaptation of Generative Adversarial Networks

Zicheng Zhang, Yinglu Liu|arXiv (Cornell University)|2022. 09. 08.
Generative Adversarial Networks and Image Synthesis인용 수 11
한 줄 요약

이 논문은 GAN에서 일반화된 원샷 도메인 적응을 위한 새로운 프레임워크를 제안하며, 참조 이미지와 그 이진 마스크를 사용하여 동시에 스타일 및 엔티티 전달을 가능하게 한다. 내부 분포를 정렬하기 위해 절단된 와서르슈타인 거리(스liced Wasserstein distance)를 활용하고, 다양체 일致성(distribution consistency)을 위해 변동형 라플라시안 정규화를 도입함으로써, 높은 품질의 합성 결과를 얻고, 도메인 간 대응 관계를 향상시키며, 제어 가능한 이미지 조작을 실현한다.

ABSTRACT

The adaptation of a Generative Adversarial Network (GAN) aims to transfer a pre-trained GAN to a target domain with limited training data. In this paper, we focus on the one-shot case, which is more challenging and rarely explored in previous works. We consider that the adaptation from a source domain to a target domain can be decoupled into two parts: the transfer of global style like texture and color, and the emergence of new entities that do not belong to the source domain. While previous works mainly focus on style transfer, we propose a novel and concise framework to address the extit{generalized one-shot adaptation} task for both style and entity transfer, in which a reference image and its binary entity mask are provided. Our core idea is to constrain the gap between the internal distributions of the reference and syntheses by sliced Wasserstein distance. To better achieve it, style fixation is used at first to roughly obtain the exemplary style, and an auxiliary network is introduced to the generator to disentangle entity and style transfer. Besides, to realize cross-domain correspondence, we propose the variational Laplacian regularization to constrain the smoothness of the adapted generator. Both quantitative and qualitative experiments demonstrate the effectiveness of our method in various scenarios. Code is available at \url{https://github.com/zhangzc21/Generalized-One-shot-GAN-adaptation}.

연구 동기 및 목표

  • 기존의 원샷 GAN 적응 방법이 스타일 전달에만 집중하면서 엔티티 전달를 간과하는 한계를 해결한다.
  • 목표 도메인을 더 정확히 정의하기 위해 이진 엔티티 마스크를 포함한 일반화된 원샷 GAN 적응 작업을 정식화한다.
  • 단일 참조 이미지로부터 전역적인 스타일(색상, 텍스처)과 특정 엔티티(예: 모자, 액세서리)를 동시에 전달할 수 있도록 한다.
  • 내용 왜곡을 방지하기 위해 소스 생성 다양체의 기하학적 구조를 유지한다.
  • 적응된 생성자(generator)를 활용해 의미 편집, 스타일 전달, 엔티티 제거와 같은 다양한 이미지 조작 작업을 유연하게 지원한다.

제안 방법

  • 생성자를 스타일화된 이미지 생성을 위한 메인 브랜치와 이진 마스크를 활용한 엔티티 전용 생성을 위한 보조 브랜치로 분리한다.
  • 잠재 공간 변환을 통한 스타일 고정(stylistic fixation)을 적용하여 모든 생성된 이미지가 예시 이미지의 스타일에 고정되도록 한다.
  • 참조 이미지의 내부 특징 분포와 생성된 이미지 간의 절단된 와서르슈타인 거리를 최소화하여 스타일 및 엔티티 표현을 정렬한다.
  • 생성자의 업데이트를 부드럽게 하고 소스 다양체의 기하학적 구조를 유지하기 위해 변동형 라플라시안 정규화를 도입한다.
  • 재구성 손실과 함께 스타일 및 엔티티 전용 손실을 결합하여 훈련 안정성과 품질 향상을 도모한다.
  • 잠재 코드 조작을 통해 적응된 생성자를 의미 편집 및 엔티티 조작과 같은 후행 작업에 활용한다.

실험 결과

연구 질문

  • RQ1단일 참조 이미지와 마스크만으로도 원샷 환경에서 스타일과 새로운 엔티티를 효과적으로 전달할 수 있는 GAN 적응 프레임워크는 가능한가?
  • RQ2이진 엔티티 마스크를 통합함으로써 스타일 전용 접근법에 비해 정확도와 유연성이 얼마나 향상되는가?
  • RQ3내부 특징 분포 간의 절단된 와서르슈타인 거리가 스타일 및 엔티티 구성 요소 모두의 분포 정렬에 얼마나 기여하는가?
  • RQ4변동형 라플라시안 정규화가 소스 다양체의 기하학적 구조를 효과적으로 유지하고 적응 과정에서의 내용 왜곡을 방지하는가?
  • RQ5적응된 생성자가 고해상도를 유지하면서도 의미 편집 및 엔티티 제거와 같은 고급 이미지 조작 작업을 지원할 수 있는가?

주요 결과

  • 제안된 방법은 일반화된 원샷 GAN 적응에서 최신 기준(SOTA) 성능을 달성하여, FSGA, MTG, JoJoGAN, OSCLIP 등의 베이스라인보다 정량적·정성적 평가에서 모두 뛰어난 성능을 보였다.
  • 절단 분석을 통해 엔티티 손실($\mathcal{L}_{ent}$)이 목표 엔티티 생성에 필수적이며, 변동형 라플라시안 정규화($\mathcal{L}_{VLapR}$)가 노이즈와 아티팩트를 크게 감소시킴을 확인했다.
  • 스태일 손실($\mathcal{L}_{style}$)을 제거하면 Inception Score(IS)와 Fréchet Inception Distance(FID)는 향상되지만, 시각적 품질은 악화되어, 지표 성능와 인지적 품질 간의 상충 관계가 있음을 시사한다.
  • 적응된 생성자는 강력한 도메인 간 대응 관계를 유지하여, 얼굴, 개, 성당 등 다양한 소스 도메인에서 내용과 엔티티에 대한 정확한 의미 편집이 가능했다.
  • 이 프레임워크는 스타일 전달, 자세/연령 편집, 엔티티 제거와 같은 고급 조작 작업을 지원하여 예술적 창작에 실용성을 입증했다.
  • 학습 시간이 효율적이다: RTX 3090에서 비어 있는 마스크가 포함된 참조 이미지의 경우 3~5분, 마스크가 없는 경우 3분으로, FSGA(48분)와 비교해 상당히 빠르다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.