Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Disentangled Representation for One-shot Progressive Face Swapping

Qi Li, Ning Wang|arXiv (Cornell University)|2022. 03. 24.
Face recognition and analysis인용 수 11
한 줄 요약

이 논문은 이중 인코더 아키텍처와 의미 지도형 융합 모듈을 사용하여 신원과 특징 표현을 분리하는 GAN 기반의 일장진행형 얼굴 교체 기법인 FaceSwapper을 제안한다. 의미 마스크와 얼굴 랜드마크를 활용하여, 한 명의 신원에 대해 하나의 소스 및 타겟 이미지만을 사용하는 벤치마크 데이터셋에서 최신 기술 수준(SOTA) 성능을 달성하며, 개선된 신원 유지 및 특징 충실도를 보장하는 제어 가능한 사진처럼 생긴 얼굴 교체를 실현한다.

ABSTRACT

Although face swapping has attracted much attention in recent years, it remains a challenging problem. Existing methods leverage a large number of data samples to explore the intrinsic properties of face swapping without considering the semantic information of face images. Moreover, the representation of the identity information tends to be fixed, leading to suboptimal face swapping. In this paper, we present a simple yet efficient method named FaceSwapper, for one-shot face swapping based on Generative Adversarial Networks. Our method consists of a disentangled representation module and a semantic-guided fusion module. The disentangled representation module comprises an attribute encoder and an identity encoder, which aims to achieve the disentanglement of the identity and attribute information. The identity encoder is more flexible, and the attribute encoder contains more attribute details than its competitors. Benefiting from the disentangled representation, FaceSwapper can swap face images progressively. In addition, semantic information is introduced into the semantic-guided fusion module to control the swapped region and model the pose and expression more accurately. Experimental results show that our method achieves state-of-the-art results on benchmark datasets with fewer training samples. Our code is publicly available at https://github.com/liqi-casia/FaceSwapper.

연구 동기 및 목표

  • 한 명의 신원에 대해 소스 및 타겟 이미지가 각각 하나뿐인 상황에서의 일장 얼굴 교체 과제를 해결하기 위해.
  • 제어 가능성과 현실감을 향상시키기 위해 얼굴 교체에서 신원과 특징의 분리 표현을 개선하기 위해.
  • 대규모 데이터셋에 대한 의존도를 줄이기 위해 소수의 샘플로부터 효과적으로 학습할 수 있도록 하기 위해.
  • 융합 과정에서 자세와 표정 모델링의 정확도를 높이기 위해 의미 지도(랜드마크 및 마스크)를 도입하기 위해.
  • 진행형 얼굴 교체를 통해 일장 얼굴 교체의 다양성과 시각적 품질을 향상시키기 위해.

제안 방법

  • 분리 표현 모듈은 잠재 공간에서 신원과 특징 정보를 분리하기 위해 신원 인코더와 특징 인코더를 사용한다.
  • 신원 인코더는 더 유연하게 설계되어, 미리 보지 않은 신원에 대해서도 더 나은 일반화 성능을 발휘한다.
  • 특징 인코더는 이전 방법보다도 더 효과적으로 주름이나 조명 변화와 같은 미세한 디테일을 유지한다.
  • 의미 지도형 융합 디코더는 얼굴 랜드마크와 의미 마스크를 사용하여 교체 영역을 제어하고 자세 및 표정을 정렬한다.
  • 재구성, 신원 유지, 특징 유지, 그리고 적대적 손실을 포함한 다중 손실 학습 목표를 적용한다.
  • 프레임워크는 엔드 투 엔드로 학습 가능하며, 점진적으로 생성된 얼굴 이미지를 개선함으로써 진행형 얼굴 교체를 가능하게 한다.

실험 결과

연구 질문

  • RQ1GAN 기반 방법이 한 명의 신원에 대해 하나의 소스 및 타겟 이미지만을 사용할 때에도 고성능의 얼굴 교체를 달성할 수 있는가?
  • RQ2일장 설정에서 신원과 특징 표현이 얼마나 효과적으로 분리될 수 있는가?
  • RQ3랜드마크와 마스크를 통한 의미 지도가 얼굴 교체 과정에서 자세와 표정 일관성 향상에 어떤 역할을 하는가?
  • RQ4다양한 손실 구성 요소가 신원 유지와 시각적 현실감에 기여하는 정도는 어떠한가?
  • RQ5진행형 얼굴 교체가 일장 얼굴 교체의 다양성과 제어 가능성을 향상시킬 수 있는가?

주요 결과

  • FaceSwapper는 FaceForensics++ 데이터셋에서 93.86%의 신원 검색 점수를 기록하여, 모든 아블레이션 변형보다 뛰어나 최신 기술 수준(SOTA) 성능을 확립했다.
  • 신원 유지 손실을 제거한 경우(FS_wo_id) 신원 검색 점수가 단 0.24%로 떨어져, 이 손실이 소스 신원을 유지하는 데 핵심적인 역할을 한다는 것을 확인했다.
  • 저자세 오차(2.36)와 저표정 오차(2.99)를 유지하여, 타겟 얼굴 기하학적 형태와 표정을 정확히 모델링하고 있음을 나타낸다.
  • 아블레이션 연구 결과, 적대적 손실을 생략할 경우 자세 오차가 7.84로 크게 증가하여, 현실감 향상에 있어 이 손실의 중요성을 입증했다.
  • 의미 지도형 융합 모듈은 성능 향상에 기여한다: FS-B(의미 마스크 없음)는 신원 유지에 실패하고, FS-C는 타겟 특징 충실도를 상실한다.
  • 모든 손실이 포함된 전체 방법은 신원 유지, 특징 충실도, 현실감의 최적의 균형을 달성하여, 완전한 손실 구성이 반드시 필요하다는 것을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.