[논문 리뷰] Adaptable GAN Encoders for Image Reconstruction via Multi-type Latent Vectors with Two-scale Attentions
이 논문은 다양한 사전 훈련된 GAN, 특히 비정렬 또는 실사 이미지를 생성하는 GAN들에서도 고해상도 이미지 복원을 가능하게 하는 새로운 GAN 인코더 프레임워크인 MTV-TSA를 제안한다. 다중 유형의 잠재 벡터와 이중 스케일 주의 메커니즘을 사용함으로써, 통합된 합성곱 블록과 정밀 조정된 정규화 레이어를 통해 다양한 GAN 아키텍처에 적응함으로써 더 빠른 수렴과 뛰어난 성능을 달성한다.
Although current deep generative adversarial networks (GANs) could synthesize high-quality (HQ) images, discovering novel GAN encoders for image reconstruction is still favorable. When embedding images to latent space, existing GAN encoders work well for aligned images (such as the human face), but they do not adapt to more generalized GANs. To our knowledge, current state-of-the-art GAN encoders do not have a proper encoder to reconstruct high-fidelity images from most misaligned HQ synthesized images on different GANs. Their performances are limited, especially on non-aligned and real images. We propose a novel method (named MTV-TSA) to handle such problems. Creating multi-type latent vectors (MTV) from latent space and two-scale attentions (TSA) from images allows designing a set of encoders that can be adaptable to a variety of pre-trained GANs. We generalize two sets of loss functions to optimize the encoders. The designed encoders could make GANs reconstruct higher fidelity images from most synthesized HQ images. In addition, the proposed method can reconstruct real images well and process them based on learned attribute directions. The designed encoders have unified convolutional blocks and could match well in current GAN architectures (such as PGGAN, StyleGANs, and BigGAN) by fine-tuning the corresponding normalization layers and the last block. Such well-designed encoders can also be trained to converge more quickly.
연구 동기 및 목표
- 다양한 사전 훈련된 GAN에서 비정렬 또는 실사 이미지를 포함한 고해상도 이미지 복원에 있어 기존 GAN 인코더의 한계를 해결하는 것.
- PGGAN, StyleGAN, BigGAN와 같은 다양한 GAN 아키텍처에 적응 가능한 통합된 인코더 아키텍처를 개발하는 것.
- 정렬된 얼굴 이미지 외의 GAN에서의 이미지 복원에 대해 복원 정밀도와 수렴 속도를 향상시키는 것.
- 제안된 인코더를 통해 잠재 공간에서 분리된 속성 방향을 학습함으로써 실사 이미지에서의 속성 조작을 가능하게 하는 것.
제안 방법
- 다양한 이미지 특성을 잠재 공간에서 표현하기 위해 다중 유형의 잠재 벡터(MTV)를 도입하여 표현 능력을 향상시킨다.
- 전역 및 국소 이미지 특징을 추출하기 위해 이중 스케일 주의(TSA)를 적용함으로써 특징 정렬과 복원 정확도를 향상시킨다.
- 다양한 GAN 아키텍처에서의 성능 일관성을 확보하기 위해 일반화된 손실 함수를 설계한다.
- 특정 GAN 아키텍처에 맞추기 위해 통합된 합성곱 블록과 최종 블록, 정규화 레이어를 정밀 조정한다.
- 퍼셉추얼 품질과 복원 정밀도를 균형 있게 유지하기 위해 두 종류의 손실 함수를 사용하여 엔드 투 엔드로 훈련한다.
- StyleGAN, PGGAN, BigGAN 등의 기존 GAN과 호환되며, 최소한의 아키텍처 수정으로 즉시 적용 가능한 플러그 앤 플레이 적응을 가능하게 한다.
실험 결과
연구 질문
- RQ1단일 인코더 아키텍처가 다양한 사전 훈련된 GAN에서 고해상도 이미지 복원에 일반화될 수 있는가?
- RQ2다중 유형의 잠재 벡터 사용이 비정렬 및 실사 이미지에서의 복원 품질을 어떻게 향상시키는가?
- RQ3이중 스케일 주의 메커니즘이 특징 표현과 복원 정밀도를 얼마나 향상시키는가?
- RQ4제안된 인코더가 기존 GAN 인코더보다 더 빠른 수렴을 달성할 수 있는가?
- RQ5학습된 잠재 공간이 실사 이미지에서 의미 있는 속성 조작을 지원할 수 있는가?
주요 결과
- 제안된 MTV-TSA 인코더는 최신 기술 대비 비정렬 고해상도 이미지에서 더 높은 복원 정밀도를 달성한다.
- 잠재 공간에서 분리된 속성 방향을 학습함으로써 실사 이미지로부터 효과적인 이미지 복원이 가능하다.
- 통합된 합성곱 블록과 정밀 조정된 정규화 레이어 덕분에 훈련 중 더 빠른 수렴을 달성한다.
- PGGAN, StyleGAN, BigGAN와 같은 다양한 GAN 아키텍처와 호환되며, 주요 아키텍처 수정 없이도 적용 가능하다.
- 이중 스케일 주의의 사용은 국소 세부 사항과 전반적 맥락을 모두 잘 포착함으로써 특징 표현을 크게 향상시킨다.
- 일반화된 손실 함수는 안정적인 훈련과 재구성된 이미지의 향상된 퍼셉추얼 품질에 기여한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.