Skip to main content
QUICK REVIEW

[논문 리뷰] DeepI2I: Enabling Deep Hierarchical Image-to-Image Translation by Transferring from GANs

Yaxing Wang, Lu Yu|arXiv (Cornell University)|2020. 11. 11.
Generative Adversarial Networks and Image Synthesis참고 문헌 77인용 수 8
한 줄 요약

DeepI2I는 구조적 특징(얕은 층에서 유래)과 의미적 특징(깊은 층에서 유래)을 다중 수준에서 활용하는 깊이 있는 계층적 이미지 간 번역 프레임워크를 제안한다. 이는 형태 변화가 큰 클래스 간 번역을 향상시킨다. 사전 훈련된 BigGAN 또는 StyleGAN 모델에서 지식을 전이하고, 가중치 불일치 문제를 해결하기 위해 어댑터 네트워크를 사용함으로써, 기준 데이터셋에서 mFID를 35% 감소시켰으며, 100개 이상의 클래스에 걸쳐 고품질이고 확장 가능한 번역을 가능하게 한다.

ABSTRACT

Image-to-image translation has recently achieved remarkable results. But despite current success, it suffers from inferior performance when translations between classes require large shape changes. We attribute this to the high-resolution bottlenecks which are used by current state-of-the-art image-to-image methods. Therefore, in this work, we propose a novel deep hierarchical Image-to-Image Translation method, called DeepI2I. We learn a model by leveraging hierarchical features: (a) structural information contained in the shallow layers and (b) semantic information extracted from the deep layers. To enable the training of deep I2I models on small datasets, we propose a novel transfer learning method, that transfers knowledge from pre-trained GANs. Specifically, we leverage the discriminator of a pre-trained GANs (i.e. BigGAN or StyleGAN) to initialize both the encoder and the discriminator and the pre-trained generator to initialize the generator of our model. Applying knowledge transfer leads to an alignment problem between the encoder and generator. We introduce an adaptor network to address this. On many-class image-to-image translation on three datasets (Animal faces, Birds, and Foods) we decrease mFID by at least 35% when compared to the state-of-the-art. Furthermore, we qualitatively and quantitatively demonstrate that transfer learning significantly improves the performance of I2I systems, especially for small datasets. Finally, we are the first to perform I2I translations for domains with over 100 classes.

연구 동기 및 목표

  • 고해상도 병목 현상으로 인해 현재의 I2I 방법이 형태 변화가 큰 클래스 간 번역에 한계를 가진다는 점을 해결하기 위해.
  • 이전 모델의 약 40개 클래스 제한을 초월하여 확장 가능한 다수 클래스 이미지 간 번역을 가능하게 하기 위해.
  • 사전 훈련된 GAN에서의 지식 전이를 통해 소규모 데이터셋에서의 훈련 안정성과 성능을 향상시키기 위해.
  • 사전 훈련된 GAN 구성 요소에서 I2I 모델을 초기화할 때 발생하는 가중치 불일치 문제를 해결하기 위해.
  • 다양한 도메인에서 고해상도이고 현실적인 출력을 얻을 수 있는 깊이 있는 I2I 번역의 가능성을 입증하기 위해.

제안 방법

  • 모델은 다중 네트워크 깊이의 특징을 융합하여 구조적 정보와 의미적 정보를 모두 캡처하는 계층적 인코더-디코더 아키텍처를 사용한다.
  • I2I 모델의 인코더와 디스criminator는 BigGAN 또는 StyleGAN의 사전 훈련된 디스criminator 가중치를 사용하여 초기화된다.
  • 생성자는 동일한 GAN들로부터의 사전 훈련된 생성자 가중치를 사용하여 초기화되어 학습된 이미지 합성 능력을 전이한다.
  • 가장자 네트워크를 도입하여 사전 초기화된 인코더와 생성자 간의 특징 분포를 정렬함으로써 불일치 문제를 완화한다.
  • 잠재 클래스 임베딩을 사용함으로써 다수 클래스 번역을 지원하며, 100개 이상의 클래스에서 단일 모델로의 확장 가능한 운영을 가능하게 한다.
  • 사전 훈련된 GAN에서의 지식 전이가 수렴 속도를 가속화하고 성능을 향상시키며, 특히 소규모 데이터셋에서 유의미한 개선을 이룬다.

실험 결과

연구 질문

  • RQ1형태 변화가 큰 클래스에 대해 깊이 있는 계층적 I2I 프레임워크가 번역 품질을 향상시킬 수 있는가?
  • RQ2사전 훈련된 GAN에서의 지식 전이가 I2I 모델을 효과적으로 초기화하고 소규모 데이터셋에서 성능을 향상시킬 수 있는가?
  • RQ3제안된 어댑터 네트워크는 사전 초기화된 인코더와 생성자 구성 요소 간의 불일치를 어떻게 해결하는가?
  • RQ4제안된 방법은 이전의 I2I 시스템이 약 40개 클래스로 제한된 것과 달리, 단일 모델로 100개 이상의 클래스로 확장 가능한가?
  • RQ5계층적 특징 융합과 GAN 기반 전이 학습의 조합이 생성된 이미지의 현실성과 다양성 측면에서 열등한 성능을 낼 수 있는가?

주요 결과

  • DeepI2I는 Animal Faces, Birds, Foods 데이터셋에서 최신 기술 대비 mFID를 최소 35% 감소시켰다.
  • 모델은 이전의 단일 모델 접근 방식이 달성하지 못한 100개 이상의 클래스에서 다수 클래스 I2I 번역을 성공적으로 수행했다.
  • 사용자 연구 결과, DeepI2I는 StarGAN과 DMIT보다 유의미하게 더 현실적인 이미지를 생성하며, 이중 비교에서 78%가 DeepI2I의 출력을 선호했다.
  • 사전 훈련된 GAN에서의 지식 전이 전략은 수렴 속도를 가속화하고 성능을 향상시키며, 특히 소규모 데이터셋에서 유의미한 개선을 이뤘다.
  • 어댑터 네트워크는 인코더와 생성자 간의 불일치를 효과적으로 해결하여, 평가된 모든 데이터셋에서 일관되게 번역 품질을 향상시켰다.
  • 사전에 볼 수 없었던 I2I 번역, 예를 들어 인간 얼굴을 동물 얼굴으로 변환하는 경우에도 고품질이고 현실적인 결과를 생성하여 강력한 일반화 능력을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.