Skip to main content
QUICK REVIEW

[논문 리뷰] High-resolution Face Swapping via Latent Semantics Disentanglement

Yangyang Xu, Bailin Deng|arXiv (Cornell University)|2022. 03. 30.
Face recognition and analysis인용 수 6
한 줄 요약

이 논문은 StyleGAN의 잠재 공간에서 구조적 특성(자세, 표정)과 외형적 특성(조명, 피부 톤)을 분리하여 고해상도 얼굴 교체를 수행하는 방법을 제안한다. 이는 지문 기반 잠재 방향 전달과 다중 척도 특징 융합을 통해 이루어지며, 이미지 및 영상에서 상태의 기술(SOTA) 성능을 달성하여 환영 품질과 시간적 일관성이 향상되었고, 이전의 GAN 기반 방법보다 정밀도와 세부 사항 보존 측면에서 뛰어나다.

ABSTRACT

We present a novel high-resolution face swapping method using the inherent prior knowledge of a pre-trained GAN model. Although previous research can leverage generative priors to produce high-resolution results, their quality can suffer from the entangled semantics of the latent space. We explicitly disentangle the latent semantics by utilizing the progressive nature of the generator, deriving structure attributes from the shallow layers and appearance attributes from the deeper ones. Identity and pose information within the structure attributes are further separated by introducing a landmark-driven structure transfer latent direction. The disentangled latent code produces rich generative features that incorporate feature blending to produce a plausible swapping result. We further extend our method to video face swapping by enforcing two spatio-temporal constraints on the latent space and the image space. Extensive experiments demonstrate that the proposed method outperforms state-of-the-art image/video face swapping methods in terms of hallucination quality and consistency. Code can be found at: https://github.com/cnnlstm/FSLSD_HiRes.

연구 동기 및 목표

  • 고해상도에서의 성능 저하를 초래하는 StyleGAN 잠재 공간 내의 뒤섞인 의미 문제를 해결하기 위해.
  • 정체성, 구조(자세/표정), 외형(조명/피부 톤)을 정확히 분리하여 더 자연스러운 얼굴 교체를 가능하게 하기 위해.
  • StyleGAN의 渐진적(coarse-to-fine) 생성 특성을 활용하여 고해상도 얼굴 교체의 특징 제어를 향상시키기 위해.
  • 영상 얼굴 교체에 대해 공간-시간 일관성을 확보하여 프레임 간 불일치를 방지하기 위해.

제안 방법

  • StyleGAN의 渐진적 생성 특성을 활용하여 얕은 층의 구조적 특성(자세, 표정)과 깊은 층의 외형적 특성(조명, 피부 톤)을 분리한다.
  • 원천 및 대상 얼굴의 지문(키 포인트) 임베딩에서 유도된 지문 기반의 구조 전달 잠재 방향을 도입하여 구조 전달을 안내한다.
  • 깊은 층에서 구조 전달된 원천 잠재 코드와 대상의 외형 코드를 재조합하여 원천 정체성을 유지하면서도 대상의 구조와 외형을 채택한다.
  • StyleGAN 생성기의 생성 특징과 인코딩된 대상 특징을 융합하는 다중 척도 특징 집약 메커니즘을 적용하여 블렌딩 아티팩트를 제거한다.
  • 영상 얼굴 교체를 위해 두 가지 공간-시간 제약 조건을 강제 적용한다: 얕은 층의 잠재 오프셋에 대한 코드 궤적 제약과 RGB 공간 내의 흐름 궤적 제약.
  • 구조적 불일치를 수용하기 위해 대상 인코더-디코더를 사용하여 배경 및 얼굴 영역의 견고한 블렌딩을 가능하게 한다.

실험 결과

연구 질문

  • RQ1StyleGAN의 잠재 의미를 분리함으로써 정체성, 구조, 외형 특성을 분리함으로써 고해상도 얼굴 교체 품질을 향상시킬 수 있는가?
  • RQ2지문 기반 잠재 방향 전달은 원천 정체성을 유지하면서 정확한 구조 전달을 어떻게 가능하게 하는가?
  • RQ3얼굴 교체 과정에서 영상 프레임 간 일관성을 유지하는 데 효과적인 공간-시간 제약 조건은 무엇인가?
  • RQ4다중 척도 특징 융합은 고해상도 얼굴 교체에서 블렌딩 아티팩트를 어느 정도 감소시키는가?
  • RQ5제안된 방법은 이미지 및 영상 얼굴 교체 벤치마크에서 최고 성능을 달성할 수 있는가?

주요 결과

  • 제안된 방법은 기존 기준 방법(MegaFS 등)에 비해 환영 현상과 뿌연 현상을 크게 감소시키며 고해상도 얼굴 교체에서 최고 성능을 달성한다.
  • 정성적 결과 분석에서 외형 전달 또는 배경 융합 기능이 없는 추론 변형은 비자연스러운 스타일이나 뚜렷한 블렌딩 경계를 보이며, 제안된 구성 요소의 필요성을 확인한다.
  • 다양한 데이터셋에서의 정성적 비교를 통해 원천 정체성을 잘 유지하면서도 정확하게 대상의 얼굴 구조와 외형을 전달하는 것으로 확인되었다.
  • 코드 궤적 제약과 흐름 궤적 제약이라는 두 가지 공간-시간 제약 조건은 영상 얼굴 교체에서 간격 간 일관성을 크게 향상시켜, 단일 프레임 기반 기준 대비 불일치 현상을 제거했다.
  • 광범위한 실험을 통해 기존 GAN 기반 얼굴 교체 방법보다 뛰어난 시각적 품질과 세부 사항 보존 능력을 입증하였다. 특히 미세한 얼굴 질감과 배경 통합 측면에서 뛰어난 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.