Skip to main content
QUICK REVIEW

[논문 리뷰] StyleFaceV: Face Video Generation via Decomposing and Recomposing Pretrained StyleGAN3

Haonan Qiu, Yuming Jiang|arXiv (Cornell University)|2022. 08. 16.
Generative Adversarial Networks and Image Synthesis인용 수 13
한 줄 요약

StyleFaceV는 사전 훈련된 StyleGAN3의 잠재 공간을 분해하고 재조합하는 새로운 프레임워크를 제안하여 고해상도이자 신원을 유지하는 얼굴 영상 생성을 실현한다. 이는 잠재 공간 내에서 외형과 자세 표현을 분리하고, 시간적 LSTM을 활용해 운동 시퀀스를 생성하며, 이미지와 영상 데이터를 함께 훈련시켜 최신 기술 수준의 성능을 달성한다. 특히 고해상도 영상 훈련 데이터 없이도 1024×1024 영상 합성을 가능하게 한다.

ABSTRACT

Realistic generative face video synthesis has long been a pursuit in both computer vision and graphics community. However, existing face video generation methods tend to produce low-quality frames with drifted facial identities and unnatural movements. To tackle these challenges, we propose a principled framework named StyleFaceV, which produces high-fidelity identity-preserving face videos with vivid movements. Our core insight is to decompose appearance and pose information and recompose them in the latent space of StyleGAN3 to produce stable and dynamic results. Specifically, StyleGAN3 provides strong priors for high-fidelity facial image generation, but the latent space is intrinsically entangled. By carefully examining its latent properties, we propose our decomposition and recomposition designs which allow for the disentangled combination of facial appearance and movements. Moreover, a temporal-dependent model is built upon the decomposed latent features, and samples reasonable sequences of motions that are capable of generating realistic and temporally coherent face videos. Particularly, our pipeline is trained with a joint training strategy on both static images and high-quality video data, which is of higher data efficiency. Extensive experiments demonstrate that our framework achieves state-of-the-art face video generation results both qualitatively and quantitatively. Notably, StyleFaceV is capable of generating realistic $1024 imes1024$ face videos even without high-resolution training videos.

연구 동기 및 목표

  • 사전 훈련된 이미지 생성기로 고해상도이자 신원을 유지하는, 동적인 현실감 있는 얼굴 영상 생성에 도전한다.
  • GAN의 잠재 공간 내에서 외형과 자세가 뒤섞여 있어 발생하는 신원 이탈과 자연스럽지 않은 운동을 야기하는 기존 방법의 한계를 극복한다.
  • 고해상도 영상 훈련 데이터 없이도 고해상도(1024×1024) 얼굴 영상 생성을 가능하게 한다.
  • 제한된 영상 데이터에서 이미지와 영상 데이터를 동시에 활용하는 공동 훈련 전략을 개발하여 모델 수렴성과 성능을 향상시킨다.

제안 방법

  • 전용 특징 추출 네트워크를 사용해 사전 훈련된 StyleGAN3의 잠재 공간을 분리된 외형 및 자세 표현으로 분해한다.
  • 고정된 외형 코드와 샘플된 자세 시퀀스를 융합하여 시간적으로 일관된 영상 프레임을 생성하기 위해 잠재 코드를 재조합한다.
  • 잠재 공간 내 분리된 자세 특징에서 실시간으로 자연스러운 운동 표현을 생성하기 위해 LSTM 기반의 시간 모델을 활용한다.
  • 실제 영상 데이터와 StyleGAN3의 잠재 공간에서 애핀 변환을 통해 생성된 합성 이미지 쌍을 결합하는 공동 훈련 전략을 구현한다.
  • 훈련 안정성 향상과 기울기 흐름 유지에 기여하기 위해 잠재 코드(w*)에 대해 자기지도 기반 임베딩 손실을 도입하여 재구성 정확도를 향상시킨다.
  • 이미지 영역에서 신원 재구성보다 미세한 운동 캡처(예: 입술 움직임)를 우선시하기 위해 훈련 중 가중치 재균형을 적용한다.

실험 결과

연구 질문

  • RQ1사전 훈련된 StyleGAN3의 잠재 공간이 영상 생성을 위해 분리된 외형과 자세 구성요소로 효과적으로 분해될 수 있는가?
  • RQ2잠재 공간 내 분리된 자세 표현에서 시간적으로 일관되고 동적인 운동 시퀀스를 어떻게 합성할 수 있는가?
  • RQ3제한된 영상 데이터와 합성 이미지 쌍을 활용한 공동 훈련 전략이 고해상도 영상 감독 없이 영상 생성 품질을 어느 정도 향상시킬 수 있는가?
  • RQ4이 프레임워크는 고해상도 훈련 영상이 없는 상황에서도 고해상도 1024×1024 얼굴 영상 생성이 가능한가?
  • RQ5잠재 코드에 대한 자기지도 기반 임베딩 손실이 이미지 수준의 재구성 손실만을 사용할 때보다 모델 수렴성과 재구성 정확도를 어떻게 향상시키는가?

주요 결과

  • StyleFaceV는 FID-RAVDESS 15.42, FID-Mixture 25.31, FVD 118.72를 기록하며 기존 방법보다 뚜렷이 뛰어난 최신 기술 수준의 성능을 달성한다.
  • 고해상도 훈련 영상이 전혀 없는 상황에서도 고해상도 1024×1024 얼굴 영상 생성이 가능하여 강력한 일반화 능력과 데이터 효율성을 입증한다.
  • 잠재 코드(w*)에 대한 자기지도 기반 임베딩 손실은 재구성 정확도를 향상시켜 FID-RAVDESS를 손실 없이 102.97에서 15.42로 감소시키며, arcface 유사도를 0.6676에서 0.7266으로 상승시킨다.
  • 가중치 재균형 전략을 통해 모델은 미세한 운동 세부 정보(예: 입술 움직임)에 집중할 수 있었으며, FVD는 재균형 없이 722.84에서 118.72로 감소했다.
  • 공동 훈련 전략은 이미지 사전 지식과 제한된 영상 데이터를 효과적으로 활용하여 현실적이고 시간적으로 일관된 영상 생성이 가능하게 하며 강력한 신원 유지 성능을 보였다.
  • 결과적으로 영상 도메인에서 생성된 영상가 더 생생한 운동을 보였으며, 이는 직접적인 시간적 감독 덕분이지만, 이미지 도메인에서 생성된 영상 역시 매우 현실적으로 나타났다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.