Skip to main content
QUICK REVIEW

[논문 리뷰] StyleTalker: One-shot Style-based Audio-driven Talking Head Video Generation

Dongchan Min, Min‐Young Song|arXiv (Cornell University)|2022. 08. 23.
Face recognition and analysis인용 수 6
한 줄 요약

StyleTalker는 단일 참조 이미지와 오디오를 기반으로 고해상도 입술 동기화 영상을 생성하는 일방적, 오디오 주도의 헤드 모션 영상 생성 모델이다. 이는 사전 학습된 StyleGAN과 이미지 인코더를 활용하여 참조 이미지를 임베딩하고, 실제 머리 자세와 눈 깜빡임을 구현한다. 조건부 순차적 VAE와 정규화 흐름을 사용한 오디오-모션 모델링 및 대조적 입술 동기화 판별자를 통해 최신 기술 수준의 성능을 달성하며, 기존 방법보다 오디오 주도 및 운동 제어가 가능한 설정 모두에서 뛰어난 성능을 보인다.

ABSTRACT

We propose StyleTalker, a novel audio-driven talking head generation model that can synthesize a video of a talking person from a single reference image with accurately audio-synced lip shapes, realistic head poses, and eye blinks. Specifically, by leveraging a pretrained image generator and an image encoder, we estimate the latent codes of the talking head video that faithfully reflects the given audio. This is made possible with several newly devised components: 1) A contrastive lip-sync discriminator for accurate lip synchronization, 2) A conditional sequential variational autoencoder that learns the latent motion space disentangled from the lip movements, such that we can independently manipulate the motions and lip movements while preserving the identity. 3) An auto-regressive prior augmented with normalizing flow to learn a complex audio-to-motion multi-modal latent space. Equipped with these components, StyleTalker can generate talking head videos not only in a motion-controllable way when another motion source video is given but also in a completely audio-driven manner by inferring realistic motions from the input audio. Through extensive experiments and user studies, we show that our model is able to synthesize talking head videos with impressive perceptual quality which are accurately lip-synced with the input audios, largely outperforming state-of-the-art baselines.

연구 동기 및 목표

  • 기존의 일방적 오디오 주도 헤드 모션 모델이 현실적인 머리 자세와 눈 깜빡임을 생성하지 못하는 한계를 해결하기 위해.
  • 3D 얼굴 기하학적 정보나 랜드마크 없이도 오디오 주도 및 운동 제어가 가능한 헤드 모션 영상 생성을 가능하게 하기 위해.
  • 잠재공간에서 입술 움직임을 머리 운동과 눈 깜빡임에서 분리하여 독립적이고 현실적인 제어를 가능하게 하기 위해.
  • 새로운 대조적 판별자와 정규화 흐름 사전 분포를 통해 입술 동기화 정확도와 주관적 영상 품질을 향상시키기 위해.
  • 사전 학습된 이미지 생성기 모델을 최소한의 지도 학습으로 효과적으로 미세조정하여 오디오 주도 영상 합성에 활용할 수 있도록 하기 위해.

제안 방법

  • 단일 참조 이미지를 임베딩하기 위해 사전 학습된 StyleGAN과 이미지 인코더를 활용하여 정체성을 유지하면서도 오디오 주도 조작이 가능한 임베딩을 생성한다.
  • 정확한 오디오-시각적 일치를 강화하기 위해 새로운 대조적 학습 목표로 훈련된 대조적 입술 동기화 판별자(SyncNet)를 도입한다.
  • 머리 자세와 표정을 입술 움직임에서 분리된 임베딩된 운동 잠재공간을 모델링하기 위해 조건부 순차적 변동자료모델(Sequential VAE)을 활용한다.
  • 복잡하고 다중 모달인 오디오-모션 분포를 모델링하기 위해 VAE 사전 분포에 정규화 흐름을 추가하여 운동의 현실성과 다양성을 향상시킨다.
  • 학습된 오디오-모션 매핑을 활용해 오디오 기반 순수 생성 또는 운동 소스 영상에 조건을 걸어 생성하는 방식으로 영상 생성을 수행한다.
  • 예측된 오디오 주도 운동과 입술 형태에 기반해 참조 이미지의 스타일 코드를 조작하여 영상 프레임을 재구성함으로써 프레임 간 정체성을 유지한다.

실험 결과

연구 질문

  • RQ1단일 참조 이미지 기반의 헤드 모션 모델이 3D 감독이나 운동 소스 영상 없이도 현실적인 머리 자세와 눈 깜빡임을 생성할 수 있는가?
  • RQ2표준 GAN 손실에 비해 대조적 판별자가 오디오 주도 영상 생성에서 입술 동기화 정확도를 얼마나 효과적으로 향상시키는가?
  • RQ3정규화 흐름을 통한 사전 분포가 복잡하고 다중 모달인 오디오-모션 분포를 얼마나 잘 모델링할 수 있는가?
  • RQ4잠재공간에서 운동과 입술 움직임을 분리함으로써 생성된 헤드 모션 영상의 제어성과 현실성이 얼마나 향상되는가?
  • RQ5주관적 품질, 입술 동기화 정확도, 운동 자연스러움 측면에서 제안된 방법이 최신 기준 기준 모델들과 비교해 어떻게 성능을 내는가?

주요 결과

  • 오디오 주도 생성에서 StyleTalker는 입술 동기화 정확도에 대해 평균 평가 점수(MOS) 4.06 ± 0.22를 기록하여 Wav2Lip(3.50 ± 0.32) 및 기타 기준 모델들을 크게 앞서며 뛰어난 성능을 보였다.
  • 운동 제어가 가능한 생성 설정에서 StyleTalker는 입술 동기화 정확도 MOS 3.77 ± 0.26과 운동 자연스러움 3.65 ± 0.31을 기록했으며, PC-AVS(각각 3.70 ± 0.30 및 2.93 ± 0.31)를 초월했다.
  • 제거 실험 결과, 정규화 흐름을 제거할 경우 운동 자연스러움 및 영상 현실성 점수가 각각 13.89%로 떨어지며 이는 정규화 흐름이 운동 품질 향상에 결정적인 역할을 함을 시사한다.
  • SyncNet 판별자를 제거할 경우 LSE-C 점수가 8.51에서 6.71로 감소하여 정확한 입술 동기화 달성에 있어 이 판별자의 중요성을 확인했다.
  • 사용자 연구 결과, 기존 방법에 비해 StyleTalker가 더 현실적이고 자연스러운 영상을 생성함을 확인했으며, 특히 기존 방법에서 자주 생략되던 눈 깜빡임과 운동 다양성 측면에서 뛰어난 성능을 보였다.
  • 모델는 입술 움직임을 머리 자세와 눈 깜빡임에서 효과적으로 분리하여 독립적 제어가 가능하게 하며, 더 표현력 있고 현실적인 얼굴 애니메이션을 생성할 수 있었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.