Skip to main content
QUICK REVIEW

[논문 리뷰] Audio-Driven Emotional Video Portraits

Xinya Ji, Hang Zhou|arXiv (Cornell University)|2021. 04. 15.
Face recognition and analysis참고 문헌 46인용 수 9
한 줄 요약

이 논문은 감정 동적 요소를 제어 가능한 고해상도 음성 주도 영상 초상화를 생성하는 새로운 방법인 감정 영상 초상화(Emotional Video Portraits, EVP)를 제안한다. 교차 재구성 감정 분리와 목표 적응형 얼굴 합성 기반으로 음성에서 감정 무관성과 내용 의존성 잠재 공간을 분리함으로써, 시각적 해상도를 유지하면서도 부드럽고 연속적인 감정 편집이 가능하게 한다.

ABSTRACT

Despite previous success in generating audio-driven talking heads, most of the previous studies focus on the correlation between speech content and the mouth shape. Facial emotion, which is one of the most important features on natural human faces, is always neglected in their methods. In this work, we present Emotional Video Portraits (EVP), a system for synthesizing high-quality video portraits with vivid emotional dynamics driven by audios. Specifically, we propose the Cross-Reconstructed Emotion Disentanglement technique to decompose speech into two decoupled spaces, i.e., a duration-independent emotion space and a duration dependent content space. With the disentangled features, dynamic 2D emotional facial landmarks can be deduced. Then we propose the Target-Adaptive Face Synthesis technique to generate the final high-quality video portraits, by bridging the gap between the deduced landmarks and the natural head poses of target videos. Extensive experiments demonstrate the effectiveness of our method both qualitatively and quantitatively.

연구 동기 및 목표

  • 기존의 음성 주도 대화 헤드 생성 방법들이 일반적으로 입술 동기화에만 집중하고 감정 역학을 忽略하는 데서 비롯된 감정 모델링의 부재를 해결하기 위해.
  • 오직 음성 입력으로만 구성된 영상 초상화에서 제어 가능하고 연속적인 감정 편집을 가능하게 하기 위해.
  • 고해상도 합성을 위해 음성 유도 얼굴 키포인트와 목표 영상 초상화의 자연스러운 머리 자세 간 격차를 해소하기 위해.
  • 음성에서 감정-콘텐츠 엔트레인먼트 문제를 해결하기 위해 교차 재구성 기반으로 분리된 표현을 학습함으로써.
  • 감정 정확성을 유지하면서도 현실적이고 초상 일관성이 유지되는 영상 프레임을 생성할 수 있는 견고한 프레임워크를 개발하기 위해.

제안 방법

  • 음성을 지속 시간에 관계없이 감정 공간과 지속 시간에 따라 달라지는 콘텐츠 공간으로 분리하기 위해 교차 재구성 감정 분리를 제안함으로써, 분리된 표현 학습을 가능하게 한다.
  • 비균일한 길이의 음성 데이터를 정렬하여 허위 쌍 훈련 샘플을 생성하기 위해 다이내믹 타임 워핑(Dynamic Time Warping, DTW)을 사용한다.
  • 음성에서 분리된 특징를 기반으로 2차원 감정적 얼굴 키포인트 시퀀스를 생성하는 음성-키포인트 애니메이션 모듈을 활용한다.
  • 2차원 키포인트를 3차원 공간으로 투영하고 목표 영상의 머리 자세 및 윤곽선과 정렬하기 위해 3D 인식 키포인트 정렬 알고리즘을 도입한다.
  • 정렬된 키포인트를 목표 영상의 윤곽선 맵과 외관 정보와 융합하여 고품질 영상 초상화를 합성하기 위해 엣지-투-비디오 변환 네트워크를 적용한다.
  • 교차 재구성, 콘텐츠, 자기 재구성, 분류 손실을 포함하는 다중 손실 훈련 체계를 활용하여 표현 분리와 감정 정확도를 향상시킨다.

실험 결과

연구 질문

  • RQ1명시적인 감정 레이블에 의존하지 않고도 음성 주도 영상 생성이 제어 가능하고 연속적인 감정 편집을 달성할 수 있는가?
  • RQ2원시 음성에서 감정과 음성 콘텐츠를 효과적으로 분리하여 독립적인 제어를 가능하게 할 수 있는가?
  • RQ3합성된 얼굴 키포인트가 목표 영상의 3차원 머리 자세와 얼마나 잘 정렬될 수 있는가? 이로 인해 시각적 잡음이 어느 정도 감소하는가?
  • RQ4DTW 기반 허위 쌍을 사용한 교차 재구성은 종래의 엔드 투 엔드 방법에 비해 감정 분리 및 분류 정확도를 향상시키는가?
  • RQ5제안된 방법은 음성 입력으로부터 정체성과 감정 역동성을 모두 유지하는 고해상도 영상 초상화를 생성할 수 있는가?

주요 결과

  • 제안된 EVP 방법은 MEAD 테스트 세트에서 감정 분류 정확도 83.58%를 달성하여, Wang et al. [37]의 76.00% 결과를 뛰어넘어 감정 정확도 향상을 입증한다.
  • 절단 실험 결과, 교차 재구성 손실를 제거할 경우 감정 분류 정확도가 69.79%로 감소하여, 이 손실이 표현 분리에 핵심적인 역할을 한다는 것을 확인한다.
  • 3D 인식 키포인트 정렬 기반의 목표 적응형 얼굴 합성은 정성적 비교를 통해 키포인트와 얼굴 윤곽선 간의 눈에 띄는 잡음과 이격 현상을 감소시킴을 보여준다.
  • 정량적 절단 실험을 통해 교차 재구성, 콘텐츠, 자기 재구성, 분류 손실의 네 가지 손실 모두가 키포인트 예측 및 표현 분리에 기여한다는 것을 확인한다.
  • 잠재 감정 공간 내 선형 보간은 슬픈 감정에서 기쁨으로의 매끄럽고 일관된 감정 전환을 가능하게 하여 연속적인 감정 편집 능력을 입증한다.
  • 정성적 및 정량적 평가에서 모두 최신 기술 수준의 성능을 달성하였으며, 뛰어난 시각적 품질과 정확한 감정 제어 능력을 확보한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.