Skip to main content
QUICK REVIEW

[논문 리뷰] HifiFace: 3D Shape and Semantic Prior Guided High Fidelity Face Swapping

Yuhan Wang, Xu Chen|arXiv (Cornell University)|2021. 06. 18.
Face recognition and analysis참고 문헌 23인용 수 8
한 줄 요약

HifiFace는 3D 형태 인식 정규화 및 의미적 얼굴 융합(SFF) 모듈을 활용하여 원본 얼굴 형태를 유지하면서 고해상도 얼굴 교체를 수행하는 엔드 투 엔드 딥 러닝 프레임워크를 제안한다. 3D 모형 모델(3DMM) 기하학과 정체성 특징, 적응형 특징 블렌딩을 결합함으로써 HifiFace는 자연광선의 얼굴 이미지에서 정체성 유지 및 현실감 있는 결과 측면에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

In this work, we propose a high fidelity face swapping method, called HifiFace, which can well preserve the face shape of the source face and generate photo-realistic results. Unlike other existing face swapping works that only use face recognition model to keep the identity similarity, we propose 3D shape-aware identity to control the face shape with the geometric supervision from 3DMM and 3D face reconstruction method. Meanwhile, we introduce the Semantic Facial Fusion module to optimize the combination of encoder and decoder features and make adaptive blending, which makes the results more photo-realistic. Extensive experiments on faces in the wild demonstrate that our method can preserve better identity, especially on the face shape, and can generate more photo-realistic results than previous state-of-the-art methods.

연구 동기 및 목표

  • 기존 방법이 2D 랜드마크나 텍스처 기반 인식에 의존함으로써 안정적으로 원본 얼굴 형태를 유지하지 못하는 문제를 해결하기 위해, 고해상도 얼굴 교체에서 원본 얼굴 형태 유지에 초점을 맞춘다.
  • 통합 엔드 투 엔드 프레임워크 내에서 조명, 가림, 배경 일관성 문제를 해결함으로써 현실감 있는 결과를 향상시킨다.
  • 블렌딩 기반 방법의 한계를 극복하여 원본과 대상 간 얼굴 기하학적 차이가 있을 경우 형태 전달이 제한되고 잡음이 발생하는 문제를 해결한다.
  • 정체성을 유지하면서도 표정, 자세, 조명 등의 대상 속성에 적응할 수 있는 병합된 특징 및 이미지 수준의 융합 메커니즘을 개발한다.

제안 방법

  • 원본 및 대상 얼굴의 3DMM 계수를 조합하여 기하학적 정보를 반영한 정체성 벡터를 생성하는 3D 형태 인식 정체성 추출기를 도입한다. 이는 얼굴 형태의 기하학적 감독을 가능하게 한다.
  • 3D 얼굴 재구성 모델을 사용하여 원본 및 대상 얼굴의 3DMM 계수를 추정하고, 이를 재조합하여 기하학적 정보를 반영한 표현을 감독에 활용한다.
  • 학습된 얼굴 마스크를 사용하여 저수준 인코더 및 디코더 특징을 적응형으로 융합하는 의미적 얼굴 융합(SFF) 모듈을 제안한다. 이는 텍스처 및 속성 일관성을 향상시킨다.
  • 확장된 얼굴 의미 세그멘테이션 헤드를 사용하여 적응형 블렌딩 마스크 생성을 감독함으로써, 강력한 가장자리 블렌딩 및 가림 처리를 가능하게 한다.
  • 정체성 손실, 형태 손실, 인지 손실을 포함한 다중 손실 최적화를 통해 엔드 투 엔드 학습을 수행함으로써 정체성 유지와 현실감의 균형을 맞춘다.
  • SFF 모듈에서 예측된 마스크를 최종 블렌딩에 사용하여 대상 이미지 마스크에 의존하지 않으며, 그로 인해 그림자 효과와 잡음이 감소한다.

실험 결과

연구 질문

  • RQ12D 랜드마크나 인식 기반 방법에 비해 3D 기하학적 감독이 얼굴 형태 유지에 크게 기여하는가?
  • RQ2특징 및 이미지 수준에서 학습 가능한 적응형 융합 메커니즘이 정체성을 유지하면서도 현실감 있는 결과를 향상시키는가?
  • RQ3형태 불일치 및 가림 상황을 다룰 때 제안된 SFF 모듈이 표준 블렌딩 또는 연결 방식보다 우수한가?
  • RQ4표준 정체성 벡터에 비해 3D 형태 인식 정체성 벡터가 형태 오차를 얼마나 줄이는가?

주요 결과

  • HifiFace는 비교된 모든 방법 중에서 가장 낮은 얼굴 형태 오차(L2 거리의 정체성 계수)를 기록했으며, 대형 형태 변화 상황에서 95%의 샘플이 FaceShifter보다 작은 형태 오차를 보였다.
  • FF++ 및 DFDC 데이터셋에서 최신 기술 수준의 방법들을 초월하여, 얼굴 위조 탐지 벤치마크에서 가장 높은 현실감 점수를 기록했다.
  • 절단 실험 결과 SFF 모듈이 이미지 품질 및 속성 일관성을 크게 향상시키며 잡음과 배경 불일치를 감소시킴을 확인했다.
  • 3D 형태 인식 정체성 구성 요소는 필수적이다. 이를 제거할 경우 심각한 형태 왜곡과 잡음이 발생하여 기하학적 정확성 유지를 위한 역할을 입증했다.
  • SFF 모듈은 형태 전환 영역에서 얼굴 경계에서 효과적인 인painting을 가능하게 하며, 차이 특징 맵을 통해 형태 전이 영역에서 잡음 감소가 뚜렷하게 나타남을 보여주었다.
  • HifiFace는 더 높은 생성 품질을 유지하면서도 FaceShifter보다 빠르며, 자연광선의 얼굴 이미지에서 효율성과 확장성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.