Skip to main content
QUICK REVIEW

[논문 리뷰] Feature-Style Encoder for Style-Based GAN Inversion

Xu Yao, Alasdair Newson|arXiv (Cornell University)|2022. 02. 04.
Generative Adversarial Networks and Image Synthesis인용 수 12
한 줄 요약

이 논문은 스타일 기반 GAN의 잠재 공간에서 특징과 스타일 표현을 분리하는 Feature-Style 인코더를 제안한다. 이는 추론 시 최적화가 필요 없이 고해상도 이미지 복원과 강건한 편집을 가능하게 하며, 재구성과 편집을 위한 특징 코드와 잠재 코드를 함께 학습함으로써 최신 기술 대비 50% 낮은 LPIPS를 달성하고 영상 복원 일致성도 향상시킨다.

ABSTRACT

We propose a novel architecture for GAN inversion, which we call Feature-Style encoder. The style encoder is key for the manipulation of the obtained latent codes, while the feature encoder is crucial for optimal image reconstruction. Our model achieves accurate inversion of real images from the latent space of a pre-trained style-based GAN model, obtaining better perceptual quality and lower reconstruction error than existing methods. Thanks to its encoder structure, the model allows fast and accurate image editing. Additionally, we demonstrate that the proposed encoder is especially well-suited for inversion and editing on videos. We conduct extensive experiments for several style-based generators pre-trained on different data domains. Our proposed method yields state-of-the-art results for style-based GAN inversion, significantly outperforming competing approaches. Source codes are available at https://github.com/InterDigitalInc/FeatureStyleEncoder .

연구 동기 및 목표

  • 기존 GAN 복원 방법의 한계를 해결하기 위해, 시각적 품질이 낮고 재구성 오차가 크며 영상 시퀀스에서 불안정한 문제를 해결한다.
  • 복원 및 편집을 위한 향상된 성능을 얻기 위해 잠재 공간에서 특징과 스타일 표현을 분리하는 엔드 투 엔드 인코더를 개발한다.
  • 추론 시 최적화가 필요 없도록 하여 빠르고 일관된 이미지 및 영상 편집을 가능하게 한다.
  • 비정상적인 데이터, 예를 들어 대화형 얼굴 영상에서의 비면대면 자세와 같은 경우에도 일반화 능력을 향상시킨다.
  • 고해상도 재구성과 효과적인 편집 능력 사이의 균형 잡힌 트레이드오프를 달성한다.

제안 방법

  • 모델은 이중 브랜치 인코더를 사용한다: 하나의 브랜치는 공간적 세부 정보를 위한 특징 코드를 예측하고, 다른 하나는 스타일 조작을 위한 잠재 코드를 예측한다.
  • 특징 코드는 사전 학습된 StyleGAN2 생성기의 중간 특징 맵에서 유도되며, 세밀한 구조를 유지한다.
  • 잠재 코드는 스타일 인식 헤드를 통해 예측되며, 메이크업, 눈 색상과 같은 외관 특성의 분리된 편집을 가능하게 한다.
  • 다중 척도의 시각적 손실을 사용하여 특징 코드를 지도함으로써 재구성 정확도를 향상시킨다.
  • 모델는 종합 손실을 통해 엔드 투 엔드로 훈련되며, 특징에 대한 시각적 손실, 생성된 이미지에 대한 재구성 손실, 그리고 분리 가능성 확보를 위한 사이클 일致성 손실이 포함된다.
  • 특수 생성 이미지를 훈련 중에 사용하여, 특히 분포 외 입력에 대해 강건성과 일반화 능력을 향상시킨다.

실험 결과

연구 질문

  • RQ1잠재 공간에서 특징과 스타일 표현을 분리하면 추론 시 최적화 없이도 GAN 복원 품질이 향상될 수 있는가?
  • RQ2특징 코드와 잠재 코드의 공동 학습은 재구성 정확도와 편집 능력에 어떤 영향을 미치는가?
  • RQ3제안된 인코더는 영상 시퀀스에서 비면대면 자세와 같은 어려운 케이스에 일반화될 수 있는가?
  • RQ4다중 척도의 시각적 지도와 합성 데이터는 복원 성능에 어떤 영향을 미치는가?
  • RQ5이 방법은 이미지 및 영상에서 최신 기술 대비 정량적·정성적으로 어떻게 비교되는가?

주요 결과

  • 제안된 방법은 FFHQ에서 LPIPS 점수 0.064를 달성하여 다음으로 좋은 방법(pSp: 0.143)보다 50% 향상되었으며, 최신 기술 대비 20–50% 감소하였다.
  • 영상 복원에서 SSIM 0.818, PSNR 26.64, LPIPS 0.122를 기록하여 재구성 및 시각적 품질 모두에서 모든 기준 모델을 능가했다.
  • 절단 실험 결과 다중 척도 시각적 손실이 시각적 품질을 향상시킴을 확인했다(FID: 19.03 vs. 22.63, 무시할 경우), 특징 브랜치는 해상도 유지에 필수적임을 입증했다(FID: 35.28, 무시할 경우).
  • 기존 방법이 비면대면 시각에서 실패하는 것과는 달리, 모델은 영상 시퀀스에서 극단적 자세에서도 정체성 일관성을 유지한다.
  • 훈련 시 합성 데이터 포함이 FID를 크게 향상시켰다(19.03 vs. 20.45, 합성 데이터 없을 경우), 일반화 능력 향상의 증거로 볼 수 있다.
  • 이 방법은 최적화 없이도 빠른 추론을 가능하게 하여 실시간 영상 편집 파이프라인에 적합하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.