Skip to main content
QUICK REVIEW

[논문 리뷰] HeadGAN: Video-and-Audio-Driven Talking Head Synthesis

Michail Christos Doukas, Stefanos Zafeiriou|arXiv (Cornell University)|2020. 12. 15.
Face recognition and analysis인용 수 4
한 줄 요약

HeadGAN은 드라이빙 비디오에서 추출한 3D 얼굴 표현과 음성 특징을 활용하여 신원 유지 및 사진 수준의 사실성 향상을 도모하는 GAN 기반의 대화형 헤드 합성 방법을 제안한다. 특히 극단적인 머리 자세에서도 효과적이다. 생성자에 3D 얼굴 기하학과 음성 신호를 조건으로 설정하여 더 자연스러운 입술 움직임과 현실적인 얼굴 재연을 구현한다.

ABSTRACT

Recent attempts to solve the problem of talking head synthesis using a single reference image have shown promising results. However, most of them fail to meet the identity preservation problem, or perform poorly in terms of photo-realism, especially in extreme head poses. We propose HeadGAN, a novel reenactment approach that conditions synthesis on 3D face representations, which can be extracted from any driving video and adapted to the facial geometry of any source. We improve the plausibility of mouth movements, by utilising audio features as a complementary input to the Generator. Quantitative and qualitative experiments demonstrate the merits of our approach.

연구 동기 및 목표

  • 단일 이미지 기반 대화형 헤드 합성에서의 신원 유지 문제를 해결한다.
  • 기존 방법이 실패하는 극단적인 머리 자세에서도 사진 수준의 사실성을 향상시킨다.
  • 조건부 신호로 음성 특징을 통합하여 입술 움직임의 현실성과 정확성을 향상시킨다.
  • 원본 신원에 맞게 3D 얼굴 표현을 적응시켜 안정적인 얼굴 재연을 가능하게 한다.

제안 방법

  • 드라이빙 비디오에서 추출한 3D 얼굴 표현을 생성자에 조건으로 설정하여 신원과 기하학적 구조를 유지한다.
  • 원본 이미지의 얼굴 구조에 맞게 3D 얼굴 표현을 적응시켜 신원 일치를 도모한다.
  • 음성 특징을 생성자에 추가 입력으로 통합하여 자연스러운 입술 움직임을 유도한다.
  • 감지자는 인지적 품질과 신원 일관성을 강제하는 GAN 프레임워크를 활용한다.
  • 생성자는 시각적 운동과 음성 유도 발화에 부합하는 영상 프레임을 합성하도록 훈련한다.
  • 두 단계 훈련 프로세스를 활용: 첫 번째 단계에서는 드라이빙 비디오에서 3D 얼굴 기하학을 추출하고, 두 번째 단계에서는 원본 신원, 3D 기하학, 음성 정보에 조건부로 프레임을 생성한다.

실험 결과

연구 질문

  • RQ1드라이빙 비디오에서 추출한 3D 얼굴 표현이 대화형 헤드 합성에서 신원 유지에 기여하는가?
  • RQ2음성 특징을 통합함으로써 입술 움직임이 더 자연스럽고 동기화되는가?
  • RQ3기존 방법과 비교해 극단적인 머리 자세에서 제안된 방법의 성능은 어떠한가?
  • RQ43D 기하학과 음성의 조합이 생성된 대화형 헤드의 사진 수준의 사실성에 얼마나 기여하는가?

주요 결과

  • HeadGAN은 드라이빙 비디오의 3D 얼굴 표현을 원본 이미지와 정렬시켜 뛰어난 신원 유지 성능을 달성한다.
  • 음성 특징 통합으로 입술 움직임의 현실성과 동기화가 크게 향상된다.
  • 극단적인 머리 자세에서도 뛰어난 성능을 보이며, 기존 방법보다 시각적 타당성이 뛰어나다.
  • 정량적 및 정성적 평가를 통해 생성 영상의 사진 수준의 사실성과 시간적 일관성이 향상됨을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.