Skip to main content
QUICK REVIEW

[논문 리뷰] SadTalker: Learning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation

Wenxuan Zhang, Xiaodong Cun|arXiv (Cornell University)|2022. 11. 22.
Face recognition and analysis인용 수 9
한 줄 요약

SadTalker는 음성 오디오에서 3D 운동 계수(머리 자세, 표정)를 생성하고 이를 암묵적으로 조절하는 3D 인식 얼굴 렌더러를 사용하여 고해상도 비디오 합성을 위한 혁신적인 오디오 주도 대화형 얼굴 애니메이션 시스템을 제안한다. ExpNet과 PoseVAE를 통해 표정과 자세 모델링을 분리하고, 비지도 3D 키포인트 매핑을 활용한 새로운 3D 인식 렌더러를 도입함으로써 운동의 자연스러움, 동기화, 시각적 품질 측면에서 최신 기술 수준(SOTA)의 성능을 달성한다.

ABSTRACT

Generating talking head videos through a face image and a piece of speech audio still contains many challenges. ie, unnatural head movement, distorted expression, and identity modification. We argue that these issues are mainly because of learning from the coupled 2D motion fields. On the other hand, explicitly using 3D information also suffers problems of stiff expression and incoherent video. We present SadTalker, which generates 3D motion coefficients (head pose, expression) of the 3DMM from audio and implicitly modulates a novel 3D-aware face render for talking head generation. To learn the realistic motion coefficients, we explicitly model the connections between audio and different types of motion coefficients individually. Precisely, we present ExpNet to learn the accurate facial expression from audio by distilling both coefficients and 3D-rendered faces. As for the head pose, we design PoseVAE via a conditional VAE to synthesize head motion in different styles. Finally, the generated 3D motion coefficients are mapped to the unsupervised 3D keypoints space of the proposed face render, and synthesize the final video. We conducted extensive experiments to demonstrate the superiority of our method in terms of motion and video quality.

연구 동기 및 목표

  • 기존의 오디오 주도 대화형 얼굴 애니메이션 방법이 겪는 비자연스러운 머리 움직임, 왜곡된 표정, 정체성 이탈 등의 한계를 해결하기 위해.
  • 3D 얼굴 운동 계수(머리 자세, 표정)를 분리된, 오디오 주도 표현으로 모델링하여 운동의 자연스러움과 비디오 품질을 향상시키기 위해.
  • 명시적인 3D 감독 없이도 3DMM 계수를 현실적인 비디오로 매핑할 수 있는 3D 인식 얼굴 렌더러를 개발하기 위해.
  • 단일 기준 이미지와 음성 오디오로부터 스타일리시하고 다양한, 동기화된 대화형 얼굴 생성을 가능하게 하기 위해.

제안 방법

  • ExpNet은 입술 움직임 전용 계수에서 흡수하여 음성 오디오에서 얼굴 표정 계수를 학습하고, 3D 렌더링된 얼굴에 대해 입술 읽기 및 키포인트 기반의 감각적 손실을 적용한다.
  • PoseVAE는 조건부 VAE로서 입력 오디오에 따라 조건화된 잔여 자세 변형을 학습하여 다양한 스타일의 머리 자세 운동을 모델링한다.
  • 새로운 3D 인식 얼굴 렌더러는 3DMM 운동 계수를 비지도 3D 키포인트 공간으로 매핑하여 소스 이미지의 정체성을 유지하는 왜곡을 가능하게 한다.
  • 이 시스템은 이중 단계 훈련 파이프라인을 사용한다: 먼저 표정 및 자세 헤드를 별도로 훈련하고, 이후 종단 간 추론을 통해 얼굴 렌더러를 공동으로 미세조정한다.
  • 얼굴 렌더러는 희소하고 비지도 3D 키포인트 감독을 사용하여 3DMM 계수를 2D 왜곡 필드로 변환하는 매핑 네트워크를 활용한다.
  • 프레임워크는 적대적 손실, 정체성 복원 손실, 오디오-시각 동기화 손실을 사용하여 현실성과 정렬을 보장한다.

실험 결과

연구 질문

  • RQ1오디오에서 3D 운동 계수(표정 및 자세)를 분리된 표현으로 학습함으로써 대화형 얼굴 애니메이션의 자연스러움을 향상시키고 왜곡을 줄일 수 있는가?
  • RQ2명시적인 3D 감독 없이도 3D 인식 얼굴 렌더러가 3DMM 계수에서 고품질 비디오를 효과적으로 생성할 수 있는가?
  • RQ3조건부 VAE를 통해 자세 다양성을 모델링함으로써 머리 운동의 자연스러움과 스타일리시함이 얼마나 향상되는가?
  • RQ4기존의 2D 플로우 또는 키포인트 기반 접근법과 비교해 본다면, 제안된 방법이 운동 동기화 및 시각적 품질 측면에서 뛰어난 성능을 달성할 수 있는가?
  • RQ5분리된 3D 계수 학습이 정체성 변경과 표정 왜곡을 어떻게 완화하는가?

주요 결과

  • 혼합 스타일 설정 하에서 제안된 방법은 다양성 점수 0.2778과 비트 동기화 점수 0.293을 기록하여 고정된 단일 스타일 기반 베이스라인(다양성 0.2735, 비트 동기화 0.287)을 초월한다.
  • 제거 실험 결과, GAN 손실을 제거하면 다양성은 0.2500으로 감소하고 비트 동기화는 0.271로 떨어지며, 이는 현실성 확보에 있어 그 핵심적인 역할을 한다는 것을 시사한다.
  • 초기 자세 조건을 제거하면 다양성은 0.2725로 감소하고 비트 동기화는 0.278로 떨어지며, 이는 운동 일관성 유지를 위한 중요성을 확인한다.
  • 얼굴 렌더러 제거 실험 결과, PIRenderer 대비 더 낮은 비자연스러운 얼굴 정렬 아티팩트를 보이며 더 나은 표정 재구성 성능을 나타낸다.
  • 기존 최신 기술 수준(SOTA) 방법 대비 운동 동기화 및 비디오 품질 측면에서 뛰어난 성능을 보이며, 특히 왜곡과 정체성 이탈을 줄이는 데 성공한다.
  • 한계점으로는 3DMM이 이를 모델링할 수 없어 일부 경우에 치아 아티팩트가 발생할 수 있으나, GFPGAN과 같은 후처리 복원 네트워크를 통해 이를 완화할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.