Skip to main content
QUICK REVIEW

[논문 리뷰] FaR-GAN for One-Shot Face Reenactment

Hanxiang Hao, Sriram Baireddy|arXiv (Cornell University)|2020. 05. 13.
Face recognition and analysis참고 문헌 32인용 수 11
한 줄 요약

FaR-GAN은 단일 소스 신원 이미지와 얼굴 랜드마크 마스크를 사용하여 목표 표정을 가진 사진처럼 생긴 얼굴 이미지를 생성하는 일회성 얼굴 재연 모델을 제안한다. 이는 학습 가능한 컨볼루션 레이어의 특징을 SPADE 모듈, 자기주의, 노이즈 주입과 함께 사용하는 GAN 기반 아키텍처를 활용하여 VoxCeleb1에서 최고 성능을 기록하며 FID(27.1)와 SSIM(0.68)을 달성한다. 이는 기존 방법들보다 이미지 품질과 신원 유지 측면에서 뛰어나다.

ABSTRACT

Animating a static face image with target facial expressions and movements is important in the area of image editing and movie production. This face reenactment process is challenging due to the complex geometry and movement of human faces. Previous work usually requires a large set of images from the same person to model the appearance. In this paper, we present a one-shot face reenactment model, FaR-GAN, that takes only one face image of any given source identity and a target expression as input, and then produces a face image of the same source identity but with the target expression. The proposed method makes no assumptions about the source identity, facial expression, head pose, or even image background. We evaluate our method on the VoxCeleb1 dataset and show that our method is able to generate a higher quality face image than the compared methods.

연구 동기 및 목표

  • 단일 소스 신원 이미지만 제공되는 일회성 얼굴 재연 문제를 해결하기 위해.
  • 신원, 자세, 배경에 대한 가정 없이 고정밀도의 사진처럼 생긴 얼굴 이미지를 생성하고 신원 유지와 표정 정확도를 높이기 위해.
  • 기존의 GAN 기반 및 3D 모델링 방법들과 비교해 이미지 품질을 향상시키고 잡음 제거를 위해.
  • 신원 특화 학습 데이터가 필요 없이 랜드마크만으로도 유연한 재연을 가능하게 하기 위해.
  • 자기주의 및 노이즈 주입과 같은 아키텍처 구성 요소가 재연 정확도에 미치는 영향을 탐색하기 위해.

제안 방법

  • 모델은 생성자에 콘텐츠 인코더, 스타일 인코더, 트랜스포머 네트워크를 결합한 GAN 프레임워크를 사용하여 목표 표정을 합성한다.
  • 랜드마크 마스크는 조건부 입력으로 사용되며, 부분별 의미적 분리 덕분에 바이너리 마스크보다 더 높은 성능을 발휘하는 컨투어 기반 표현 방식이 유리하다.
  • SPADE 모듈은 다중 스케일 랜드마크 마스크가 아닌 중간 컨볼루션 레이어의 학습 가능한 특징에 조건을 부여하여 더 정밀한 공간 제어를 가능하게 한다.
  • 자기주의 모듈은 생성자에 통합되어 장거리 특징 모델링을 향상시키고 공간 일관성을 개선한다.
  • 노이즈 주입은 디코딩 과정 중에 적용되어 고주파 수준의 세부 정보를 풍부하게 하며, 특히 헤어와 질감 영역에서 유의미한 개선을 이룬다.
  • 판별자는 실재 이미지와 생성된 이미지를 구분하도록 엔드 투 엔드로 훈련되어 생성자에게 사진처럼 생긴 결과를 유도한다.

실험 결과

연구 질문

  • RQ1단일 소스 이미지와 랜드마크만을 사용하는 GAN 기반 모델이 높은 정밀도의 일회성 얼굴 재연을 달성할 수 있는가?
  • RQ2다중 스케일 마스크 대신 학습 가능한 컨볼루션 특징을 사용할 경우 재연 품질에 어떤 영향을 미치는가?
  • RQ3자기주의와 노이즈 주입이 일회성 얼굴 재연에서 이미지 품질 향상과 잡음 감소에 얼마나 기여하는가?
  • RQ4사전 가정 없이 다양한 신원, 표정, 자세에서 모델의 성능은 어떠한가?
  • RQ5다양한 랜드마크 표현 형식(컨투어 vs. 바이너리 마스크)이 최종 재연 품질에 어떤 영향을 미치는가?

주요 결과

  • FaR-GAN 모델은 VoxCeleb1 데이터셋에서 Fréchet Inception Distance(FID) 27.1과 Structural Similarity Index(SSIM) 0.68을 기록하며 기준 모델들을 능가한다.
  • 컨투어 기반 랜드마크 표현 방식은 바이너리 마스크(52.1)보다 훨씬 우수한 FID(27.1)를 기록하여 부분별 의미 정보가 분리 성능을 향상시킨다는 것을 시사한다.
  • 제거 실험 결과, 자기주의와 노이즈 주입 모두 FID를 감소시키며, 구성 요소 없이 63.9에서 둘 다 포함된 경우 27.1로 개선되어 시각적 품질 향상과 잡음 감소를 확인할 수 있다.
  • 시각적 결과에서 노이즈 주입이 특히 헤어와 얼굴 질감 영역에서 고주파 세부 정보를 향상시키며, 차이 이미지 분석을 통해 이를 확인할 수 있다.
  • 대규모 자세 및 표정 변화가 있는 경우에도 모델은 신원, 배경, 옷차림을 유지하는 것으로 나타났다.
  • 강력한 성능에도 불구하고 소스와 타겟 신원 간 성별이나 얼굴 크기의 차이가 클 경우 신원 갭이 남아 있어 향후 개선이 필요하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.