Skip to main content
QUICK REVIEW

[논문 리뷰] One-Shot Face Reenactment on Megapixels

Won Jun Kang, Geonsu Lee|arXiv (Cornell University)|2022. 05. 26.
Face recognition and analysis인용 수 4
한 줄 요약

이 논문은 스타일 제너레이티브 적인 적합성 모델(StyleGAN)과 3DMM 기반 렌더링 이미지를 입력으로 사용하여 정체성, 표정, 머리 자세에 대한 명시적 제어가 가능한 일회성, 고해상도 얼굴 재연 기법인 MegaFR를 제안한다. 비디오 기반 손실 함수를 설계하고 반복적 개선을 적용함으로써 고품질 비디오 데이터셋이 없이도 사진처럼 생생한 메가픽셀 수준의 결과를 달성하며, 이는 이전 방법들에 비해 분리성과 시각적 정밀도에서 뛰어난 성능을 보인다.

ABSTRACT

The goal of face reenactment is to transfer a target expression and head pose to a source face while preserving the source identity. With the popularity of face-related applications, there has been much research on this topic. However, the results of existing methods are still limited to low-resolution and lack photorealism. In this work, we present a one-shot and high-resolution face reenactment method called MegaFR. To be precise, we leverage StyleGAN by using 3DMM-based rendering images and overcome the lack of high-quality video datasets by designing a loss function that works without high-quality videos. Also, we apply iterative refinement to deal with extreme poses and/or expressions. Since the proposed method controls source images through 3DMM parameters, we can explicitly manipulate source images. We apply MegaFR to various applications such as face frontalization, eye in-painting, and talking head generation. Experimental results show that our method successfully disentangles identity from expression and head pose, and outperforms conventional methods.

연구 동기 및 목표

  • 일회성 얼굴 재연을 위한 고품질, 고해상도 비디오 데이터셋의 부족 문제를 해결하기 위해.
  • 잠재 공간 내에서 정체성, 표정, 자세가 뒤섞이는 문제를 해결하여 제어 가능한 얼굴 편집을 가능하게 하기 위해.
  • 단일 소스 이미지만을 사용하여 고해상도(메가픽셀 수준) 얼굴 재연을 가능하게 하기 위해.
  • 극단적인 자세나 표정을 처리할 수 있도록 정체성 유지 능력을 유지하기 위해.
  • 얼굴 정면화, 눈 영역 보정, 대화 헤드 생성 등의 응용을 통해 제어 가능성의 타당성을 입증하기 위해.

제안 방법

  • 3DMM 파라미터에서 유도된 3DMM 기반 렌더링 이미지를 스타일 제너레이티브 적인 적합성 모델의 인코더에 입력으로 사용하여, 원시적인 3DMM 파라미터보다 더 해석 가능하고 CNN에 유리한 특징을 제공한다.
  • 시각적 품질과 정체성 유지 제약 조건을 활용하여 고품질 비디오 데이터셋 없이도 학습이 가능하도록 하는 새로운 손실 함수를 도입한다.
  • 재구성 품질 향상을 위해 ReStyle 방식의 최적화를 반복적으로 적용하여 극단적인 자세나 표정 상황에서도 성능을 향상시킨다.
  • 실제 소스 이미지를 스타일 제너레이티브 적인 적합성 모델의 잠재 공간으로 매핑하기 위해 GAN 역전이 기법(pSp, e4e, 또는 PTI)을 활용하며, 정체성 세부 정보를 유지한다.
  • 3DMM 파라미터를 통해 소스 이미지를 명시적으로 제어함으로써 정체성, 표정, 자세를 분리된 방식으로 조작할 수 있도록 한다.
  • 스타일 제너레이티브 적인 적합성 모델과 3DMM 사전 지식을 통합하여 제어 가능하고 고정밀도의 얼굴 생성 및 편집을 가능하게 한다.

실험 결과

연구 질문

  • RQ1고품질 비디오 데이터셋 없이 단일 소스 이미지만으로도 메가픽셀 수준의 얼굴 재연이 가능할 수 있는가?
  • RQ23DMM 기반 렌더링 이미지는 스타일 제너레이티브 적인 적합성 모델의 잠재 공간 조작에서의 해석 가능성과 성능을 향상시킬 수 있는가?
  • RQ3비디오 기반 손실 함수는 고해상도 얼굴 재연에서 정체성 유지와 사진처럼 생생한 품질을 유지하는 데 얼마나 효과적인가?
  • RQ4반복적 개선 기법은 일회성 재연에서 극단적인 얼굴 표정과 머리 자세를 효과적으로 처리할 수 있는가?
  • RQ5이 방법은 정면화나 눈 영역 보정과 같은 다른 얼굴 편집 작업으로 일반화될 수 있는가?

주요 결과

  • MegaFR는 얼굴 정면화에서 최신 기술 수준의 성능을 달성하였으며, pSp를 사용할 경우 프레셰 인ception 거리(FID)가 24.3, e4e를 사용할 경우 27.2로 기록되어 R&R(88.0)와 pSp(62.8)를 크게 앞서는 성능을 보였다.
  • pSp를 사용할 경우 LPIPS 기반의 시각적 유사도는 0.23, e4e를 사용할 경우 0.27로 정면화 결과의 높은 시각적 품질을 나타낸다.
  • 참고 이미지 없이도 직접 3DMM 파라미터를 조작함으로써 눈을 뜨는 강도를 제어할 수 있도록 눈 보정이 성공적으로 수행되었다.
  • 1024×1024 고해상도에서 입술 움직임과 표정 이동, 눈 깜빡임까지 정확하게 반영된 대화 헤드 시퀀스가 생성되었다.
  • PTI 최적화를 통해 정체성 이탈이 감소하고, 도메인 외부 이미지의 세부 정보도 유지되는 것으로 정성적 결과에서 확인되었다.
  • MegaFR는 정체성과 표정, 자세를 성공적으로 분리하여 3DMM 파라미터를 통해 얼굴 속성에 대한 명시적 제어가 가능함을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.