Skip to main content
QUICK REVIEW

[논문 리뷰] GAN Inversion for Image Editing via Unsupervised Domain Adaptation

Siyu Xing, Chen Gong|arXiv (Cornell University)|2022. 11. 22.
Domain Adaptation and Few-Shot Learning인용 수 6
한 줄 요약

이 논문은 쌍이 없는 고품질(HQ) 참조가 없는 저품질(LQ) 이미지를 재구성하고 편집할 수 있도록 하는 새로운 비지도 GAN 역행렬 방법인 UDA-Inversion을 제안한다. 고품질 이미지를 소스 도메인으로, 저품질 이미지를 레이블이 없는 타겟 도메인으로 간주함으로써, 잠재 공간에서 재구성 오차와 도메인 간 차이를 최소화한다. 이로 인해 다양한 데이터셋에서 지도 학습 방법과 비교할 만한 성능을 달성한다.

ABSTRACT

Existing GAN inversion methods work brilliantly in reconstructing high-quality (HQ) images while struggling with more common low-quality (LQ) inputs in practical application. To address this issue, we propose Unsupervised Domain Adaptation (UDA) in the inversion process, namely UDA-inversion, for effective inversion and editing of both HQ and LQ images. Regarding unpaired HQ images as the source domain and LQ images as the unlabeled target domain, we introduce a theoretical guarantee: loss value in the target domain is upper-bounded by loss in the source domain and a novel discrepancy function measuring the difference between two domains. Following that, we can only minimize this upper bound to obtain accurate latent codes for HQ and LQ images. Thus, constructive representations of HQ images can be spontaneously learned and transformed into LQ images without supervision. UDA-Inversion achieves a better PSNR of 22.14 on FFHQ dataset and performs comparably to supervised methods.

연구 동기 및 목표

  • 기존 방법이 쌍이 없는 고품질(HQ) 참조가 없어 어려움을 겪는 실제 저품질(LQ) 이미지에 대한 GAN 역행렬 문제를 해결한다.
  • 일반적으로 실제 환경에서 확보하기 어려운 쌍이 있는 HQ-LQ 데이터에 의존하는 지도 학습 기반 GAN 역행렬 방법의 한계를 극복한다.
  • 사전 학습된 GAN과 레이블이 없는 LQ 데이터만을 사용하여 LQ 이미지의 고해상도 재구성과 의미적 편집을 가능하게 한다.
  • 잠재 공간에서 소스 도메인(HQ 이미지)에서 타겟 도메인(LQ 이미지)으로 지식을 전달하기 위해 비지도 도메인 적응(UDA)을 활용한다.
  • 직접적인 지도 없이도 고품질 이미지의 구성 표현이 자발적으로 학습되고 저품질 이미지에 적응됨을 보여준다.

제안 방법

  • 비지도 도메인 적응(UDA)의 맥락에서 고품질(HQ) 이미지를 소스 도메인으로, 저품질(LQ) 이미지를 레이블이 없는 타겟 도메인으로 간주한다.
  • 재구성 오차와 잠재 공간에서 소스 도메인과 타겟 도메인의 분포 간 격리 차이를 최소화하는 방식으로 역행렬 문제를 설정한다.
  • 잠재 공간에서 소스 도메인과 타겟 도메인 간 분포 차이를 측정하기 위해 불변 함수 $ d_{s,t} $ 를 도입한다.
  • 일반화 경계를 최소화함으로써 잠재 코드 학습의 강건성을 확보하기 위해, 소스 재구성 오차와 도메인 격리 $ d_{s,t} $ 를 조합한 목적 함수를 최적화한다.
  • 사전 학습된 StyleGAN 생성자로 역행렬 잠재 코드에서 이미지를 재구성하고 편집함으로써, 잠재 공간 조작을 통한 의미적 편집을 가능하게 한다.
  • 이론적 보장(정리 1)을 적용하여 타겟 도메인 재구성 오차가 소스 오차와 도메인 격리로 상한이 있음을 보여주며, 목적 함수 최적화의 타당성을 입증한다.

실험 결과

연구 질문

  • RQ1쌍이 없는 고품질 참조가 없는 저품질 이미지에 대해 비지도 도메인 적응이 효과적으로 적용될 수 있는가?
  • RQ2소스 도메인(HQ 이미지)에서의 지식이 얼마나 타겟 도메인(LQ 이미지)으로 전이되어 정확한 재구성과 편집을 가능하게 하는가?
  • RQ3이러한 UDA-Inversion 방법은 이미지 재구성 및 편집 정밀도 측면에서 양적·정성적으로 지도 및 비지도 기준선과 어떻게 비교되는가?
  • RQ4잠재 공간에서의 도메인 격리 항목 $ d_{s,t} $ 는 LQ 이미지에 대한 역행렬 모델의 강건성과 성능에 어떤 기여를 하는가?
  • RQ5여러 도메인(예: FFHQ, Stanford Cars) 간에 일반화 가능성이 있으며, 지도 없이도 높은 품질의 편집과 재구성을 유지할 수 있는가?

주요 결과

  • UDA-Inversion은 쌍이 없는 HQ-LQ 데이터가 없는 상황에서도 FFHQ 및 Stanford Cars 데이터셋에서 지도 학습 방법과 비교할 만한 성능을 달성한다.
  • FFHQ 데이터셋에서 UDA-Inversion은 두 기준선보다 PSNR, SSIM, MSE 측면에서 HQ 이미지 재구성에서 뛰어난 성능을 보이며, LQ 이미지 재구성에 있어서도 FID와 SSIM 점수를 기준선과 유사하게 유지한다.
  • 자동차 데이터셋에서는 FID 측면에서 기준선을 일관되게 초월하며, 다른 지표에서도 유사한 성능을 기록함으로써 도메인 이동에 대한 강건성을 입증한다.
  • 편집에 대한 정량적 평가 결과, UDA-Inversion은 소스 도메인 편집에서 FID 측면에서 기준선을 뛰어넘고, 특히 '자세' 속성 편집에서 경쟁력 있는 성능을 기록한다.
  • 제거 실험 결과, 도메인 격리 항목 $ d_{s,t} $ 를 제거할 경우 세부 정보(예: 마스크) 재구성이 심각하게 실패함을 확인하여, 이 항목이 LQ 이미지 재구성의 안정성에 결정적인 역할을 함을 입증한다.
  • 정성적 결과에서는 E2Style 및 HFGI와 같은 기준선 대비 더 시각적으로 매력적인 편집 결과를 도출하며, 왜곡이 적고 의미적 변화가 더 일관됨을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.