Skip to main content
QUICK REVIEW

[논문 리뷰] Write-a-speaker: Text-based Emotional and Rhythmic Talking-head Generation

Lincheng Li, Suzhen Wang|arXiv (Cornell University)|2021. 04. 16.
Face recognition and analysis참고 문헌 63인용 수 8
한 줄 요약

이 논문은 시간에 동기화된 텍스트 입력에서 사진처럼 사실적인, 감정 표현이 풍부하고 리듬적으로 동기화된 얼굴 애니메이션과 머리 운동을 합성하는 텍스트 기반 대화형 헤드 영상 생성 프레임워크를 제안한다. 두 단계 아키텍처를 활용함으로써, 먼저 텍스트에서 얼굴 및 머리 운동을 화자 독립적으로 모델링하고, 이후 3D 얼굴 기반 주의망을 사용해 화자 특화 적응을 수행함으로써, 각 화자당 단지 5분의 참조 영상만으로도 최신 기술 수준의 성능을 달성한다.

ABSTRACT

In this paper, we propose a novel text-based talking-head video generation framework that synthesizes high-fidelity facial expressions and head motions in accordance with contextual sentiments as well as speech rhythm and pauses. To be specific, our framework consists of a speaker-independent stage and a speaker-specific stage. In the speaker-independent stage, we design three parallel networks to generate animation parameters of the mouth, upper face, and head from texts, separately. In the speaker-specific stage, we present a 3D face model guided attention network to synthesize videos tailored for different individuals. It takes the animation parameters as input and exploits an attention mask to manipulate facial expression changes for the input individuals. Furthermore, to better establish authentic correspondences between visual motions (i.e., facial expression changes and head movements) and audios, we leverage a high-accuracy motion capture dataset instead of relying on long videos of specific individuals. After attaining the visual and audio correspondences, we can effectively train our network in an end-to-end fashion. Extensive experiments on qualitative and quantitative results demonstrate that our algorithm achieves high-quality photo-realistic talking-head videos including various facial expressions and head motions according to speech rhythms and outperforms the state-of-the-art.

연구 동기 및 목표

  • 음성에 의존하는 기존 방법의 한계를 극복하고, 텍스트 입력으로부터 고해상도의 감정 표현이 풍부하고 리듬적으로 정확한 대화형 헤드 영상을 생성하는 것.
  • 청취자 특화 성능 향상을 위해 음향 특징 대신 시간에 동기화된 텍스트를 사용함으로써 톤의 격차 문제를 해결하는 것.
  • 신규 화자에 대한 참조 영상 길이를 기존의 1시간 이상에서 단지 5분으로 줄이는 것.
  • 말의 리듬과 정서와 연동된 전반적인 얼굴 표현(입, 상부 얼굴, 머리)을 모델링하는 것.
  • 장기 영상 데이터 대신 고정밀 운동 캡처 데이터를 사용해 실제적인 시각-청각 대응 관계를 수립하는 것.

제안 방법

  • 시간에 동기화된 텍스트에서 입, 상부 얼굴, 머리 자세의 애니메이션 파라미터를 생성하기 위해 세 개의 병렬 네트워크를 사용하는 화자 독립 단계를 구현한다.
  • 화자 특화 단계에서 3D 얼굴 모델 기반 주의망을 활용해 일반적인 애니메이션 파라미터를 대상 화자의 정체성에 맞게 적응시킨다.
  • 말의 리듬, 정서 및 시각적 운동 간 정확한 대응 관계를 확립하기 위해 고정밀 운동 캡처 데이터셋을 활용한다.
  • 에너지 최소화 함수를 사용해 关键 프레임 랜드마크에서 3D 모러포믹 모델(3DMM) 피팅 과정을 통해 자세 및 표정 파라미터를 추정한다.
  • 얼굴 랜드마크 및 표정 일관성에 대한 정규화 항을 포함한 적대적 손실, 재구성 손실의 조합을 사용해 네트워크를 엔드 투 엔드로 훈련시킨다.
  • 렌더링 네트워크에서 단어, 음소, 정서 임베딩(V^txt, V^ph, V^emo)을 공유 잔차 블록을 통해 사용하여 얼굴 및 마스크 생성을 수행한다.

실험 결과

연구 질문

  • RQ1음성에 의존하지 않고도 텍스트 기반 프레임워크가 감정 표현이 풍부하고 리듬적으로 정확한 대화형 헤드 영상을 생성할 수 있는가?
  • RQ2시간에 동기화된 텍스트 입력만으로 전반적인 얼굴 및 머리 운동을 효과적으로 모델링할 수 있는가?
  • RQ3기존의 1시간 이상의 영상이 필요로 했던 것에 비해, 5분 분량의 참조 영상으로도 고해상도의 화자 특화 영상 생성에 충분한가?
  • RQ4장기 영상 기록 대비 운동 캡처 데이터를 사용하면 영상 애니메이션의 품질과 정렬 정확도가 향상되는가?
  • RQ5제안된 3D 얼굴 기반 주의망 메커니즘이 생성된 영상의 정체성 유지 및 표현의 현실감을 어떻게 향상시키는가?

주요 결과

  • 제안된 방법은 말의 리듬과 정서에 맞게 동기화된 풍부한 얼굴 표정과 리듬적인 머리 운동을 갖춘 사진처럼 사실적인 대화형 헤드 영상을 생성한다.
  • 질적 및 양적 평가에서 최신 기술 수준의 방법들을 능가하며, 뛰어난 시각적 해상도와 시간적 일관성을 입증한다.
  • 화자 특화 단계는 단지 5분의 참조 영상만으로도 높은 품질의 결과를 달성하여 이전 연구 대비 데이터 요구량을 크게 줄였다.
  • 시간에 동기화된 텍스트 입력을 사용함으로써 톤의 격차 문제를 효과적으로 완화시켜 다양한 화자 및 합성 음성 입력에 대해 안정적인 성능을 발휘한다.
  • 운동 캡처 기반 훈련 데이터는 정확한 시각-청각 대응 관계 학습을 가능하게 하여 더 자연스럽고 정확하게 동기화된 애니메이션을 생성한다.
  • 본 방법은 시간에 동기화된 텍스트 표현만으로도 감정 표현이 풍부하고 리듬적인 머리 운동을 포함한 전체적인 대화형 헤드 영상을 생성한 최초의 방법이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.