[논문 리뷰] Unsupervised Image-to-Image Translation via Pre-trained StyleGAN2 Network
이 논문은 사전 훈련된 StyleGAN2 모델을 사용하여 고해상도, 다양한, 의미적으로 충실한 영역 간 번역을 가능하게 하는 비지도 이미지-이미지 번역 방법을 제안한다. 모델 변환과 잠재공간 역할을 통해 훈련 자원을 크게 줄이고, 이미지의 품질을 유지하면서 모드 붕괴를 방지하는 동시에 타겟 도메인에 대해서만 미세조정을 수행함으로써 최신 기술 수준의 성능을 달성한다.
Image-to-Image (I2I) translation is a heated topic in academia, and it also has been applied in real-world industry for tasks like image synthesis, super-resolution, and colorization. However, traditional I2I translation methods train data in two or more domains together. This requires lots of computation resources. Moreover, the results are of lower quality, and they contain many more artifacts. The training process could be unstable when the data in different domains are not balanced, and modal collapse is more likely to happen. We proposed a new I2I translation method that generates a new model in the target domain via a series of model transformations on a pre-trained StyleGAN2 model in the source domain. After that, we proposed an inversion method to achieve the conversion between an image and its latent vector. By feeding the latent vector into the generated model, we can perform I2I translation between the source domain and target domain. Both qualitative and quantitative evaluations were conducted to prove that the proposed method can achieve outstanding performance in terms of image quality, diversity and semantic similarity to the input and reference images compared to state-of-the-art works.
연구 동기 및 목표
- 기존의 비지도 I2I 번역 방법의 한계, 즉 높은 계산 비용, 훈련의 불안정성, 데이터가 균형 잡히지 않은 경우 발생하는 모드 붕괴를 해결하기 위해.
- 쌍체의 훈련 데이터나 소스 및 타겟 생성자 간의 공동 훈련이 필요 없이, 여러 도메인 간 고해상도 이미지 번역을 가능하게 하기 위해.
- 초기 소스 도메인에서의 사전 훈련 이후 타겟 도메인에서만 훈련하여 자원 소비를 줄이기 위해.
- 단일 기본 모델을 통해 점진적인 모델 변환을 통해 다중 도메인 및 다중 모드 번역을 실현하기 위해.
- 기존 최신 기술 수준의 방법들보다 이미지의 품질, 다양성, 입력/기준 이미지와의 의미적 유사성 향상을 위해.
제안 방법
- 논문은 소스 도메인에서 사전 훈련된 StyleGAN2 생성자에서 시작하며, 타겟 도메인 데이터에 대해 보수적인 미세조정과 레이어 조작을 사용하여 타겟 도메인 전용으로 변환된 생성자를 만든다.
- 모델 변환은 T_X→Y(G_X)로 정의되며, 여기서 G_Y = T_X→Y(G_X)이다. 이 변환은 타겟 도메인에만 집중하여 품질과 안정성을 유지한다.
- 입력 이미지를 그 잠재 코드 z로 매핑하기 위한 역할 방법을 제안하며, 이는 변환된 타겟 도메인 생성자에서 z를 통해 번역을 가능하게 한다.
- StyleGAN2의 분리된 스타일 공간을 활용하여 특정 레이어를 선택적으로 교환함으로써 소스 도메인과 타겟 도메인 간의 의미적 일치도를 향상시킨다.
- 사이클 일致 손실과 이중 방향 훈련을 피하여 훈련 복잡도를 줄이고, 데이터가 균형 잡히지 않은 상황에서의 모드 붕괴를 방지한다.
- 생성자의 구조적 무결성을 유지하면서 새로운 도메인에 적응하기 위해 동결된 완전 연결 레이어(Fully Connected layers)를 사용한 미세조정 전략(FC-FT)을 적용한다.
실험 결과
연구 질문
- RQ1사전 훈련된 StyleGAN2 모델이 공동 훈련 없이 모델 변환을 통해 새로운 타겟 도메인에 효과적으로 적응할 수 있는가?
- RQ2소스 도메인 이미지에서 유도된 잠재공간 역할이 변환된 타겟 도메인 생성자로 정확하게 매핑되어 충실한 이미지 번역이 가능한가?
- RQ3제안된 방법이 기존의 비지도 I2I 방법들보다 더 높은 이미지 품질, 다양성, 의미적 유사성을 달성하는가?
- RQ4기존 방법에 비해 더 적은 모델로 다중 도메인 번역을 지원할 수 있는가?
- RQ5모델 변환 중 레이어 교환은 의미적 일치도와 번역 품질에 어떤 영향을 미치는가?
주요 결과
- 제안된 방법은 얼굴에서 포트레이트로의 번역 작업에서 FID 점수 32.480을 기록하여 CycleGAN(54.472)과 MUNIT(62.683)을 크게 앞서며, 얼굴에서 애니메이션으로의 번역에서는 FID 점수 52.930을 기록하여 CycleGAN(78.452)과 MUNIT(66.261)을 압도했다.
- 레이어 교환(LS-3 for anime, LS-5 for portrait)을 적용한 결과, 얼굴에서 애니메이션 번역에서 LPIPS_s 점수 0.468을 기록하여 입력 이미지와의 의미적 유사성에서 최고 성능을 보였다.
- FC-FT-LS 변종은 얼굴에서 애니메이션 번역에서 LPIPS_d 점수 0.767을 기록하여 생성된 이미지의 다양성이 가장 뛰어났다.
- 모델 복원에서 SSIM 점수 0.667을 기록하여 Image2StyleGAN(0.613), IdInvert(0.623), 그리고 투영 기반 베이스라인(0.655)을 모두 초월했다.
- 모델 거리 측정 지표는 변환된 모델들이 기본 모델에 가까이 유지됨을 보여주며, 보수적인 미세조정과 레이어 조작의 효과를 입증했다.
- 기존 방법이 필요로 하는 6개의 모델에 비해, 이 방법은 4개의 모델만으로도 4개 도메인 중 어떤 두 도메인 간에도 임의의 I2I 번역을 가능하게 하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.