Skip to main content
QUICK REVIEW

[논문 리뷰] FaceFormer: Speech-Driven 3D Facial Animation with Transformers

Yingruo Fan, Zhaojiang Lin|arXiv (Cornell University)|2021. 12. 10.
Face recognition and analysis인용 수 15
한 줄 요약

FaceFormer는 장기적인 음성 컨텍스트와 자기학습된 음성 표현을 활용하여 현실적이고 시간적으로 일관된 3D 얼굴 메시를 생성하는 트랜스포머 기반의 자동회귀 모델을 제안한다. 정확한 입술 동기화를 구현한다. 비편향된 교차 attention과 주기적 위치 인코딩 전략을 도입하여, 인간 평가 연구와 더 긴 음성 시퀀스로의 일반화에서 최신 기술을 능가한다.

ABSTRACT

Speech-driven 3D facial animation is challenging due to the complex geometry of human faces and the limited availability of 3D audio-visual data. Prior works typically focus on learning phoneme-level features of short audio windows with limited context, occasionally resulting in inaccurate lip movements. To tackle this limitation, we propose a Transformer-based autoregressive model, FaceFormer, which encodes the long-term audio context and autoregressively predicts a sequence of animated 3D face meshes. To cope with the data scarcity issue, we integrate the self-supervised pre-trained speech representations. Also, we devise two biased attention mechanisms well suited to this specific task, including the biased cross-modal multi-head (MH) attention and the biased causal MH self-attention with a periodic positional encoding strategy. The former effectively aligns the audio-motion modalities, whereas the latter offers abilities to generalize to longer audio sequences. Extensive experiments and a perceptual user study show that our approach outperforms the existing state-of-the-arts. The code will be made available.

연구 동기 및 목표

  • 긴 음성 시퀀스에 대해 현실적이고 시간적으로 안정된 3D 얼굴 애니메이션을 생성하는 데 도전하는 것.
  • wav2vec 2.0와 같은 자기학습된 사전 훈련된 음성 표현을 활용하여 3D 음성-시각 데이터셋의 데이터 부족 문제를 해결하는 것.
  • 장거리 음성 컨텍스트와 운동 이력 모델링을 통해 입술 동기화와 얼굴 표정의 현실감을 향상시키는 것.
  • 교차 주의에 새로운 정렬 비밀을 도입하여 음성과 얼굴 운동 간의 모odal 정렬을 향상시키는 것.
  • 주기적 위치 인코딩 전략을 통해 훈련 시퀀스 길이를 초월한 더 긴 음성 시퀀스로의 일반화를 가능하게 하는 것.

제안 방법

  • 모델은 원시 음성을 처리하기 위해 자기학습된 wav2vec 2.0 표현을 활용하는 트랜스포머 인코더를 사용하여 장거리 음성 컨텍스트를 캡처한다.
  • 자기회귀 디코더는 프레임 단위로 3D 얼굴 메시를 예측하며, 인과적 자기주의를 사용하여 시간적 안정성을 확보한다.
  • 음성과 운동 모달 간의 정렬을 향상시키기 위해 쿼리-키 스코어링에 정렬 비밀을 삽입한 비편향된 다중 헤드 교차모달 주의 메커니즘을 도입한다.
  • 디코더의 자기주의에 주기적 위치 인코딩(PPE) 전략을 적용하여 시간적 비밀과 사인파 임베딩을 결합함으로써 더 긴 시퀀스로의 일반화를 향상시킨다.
  • 모델은 원시 음성에 조건부로 3D 얼굴 운동 시퀀스를 끝내기까지 엔드 투 엔드로 훈련되며, 출력으로 3D 메시 정점의 시퀀스를 사용한다.
  • 모델은 RNN 기반 반복을 피하고, 장거리 의존성과 국소 역학을 모두 모델링하기 위해 오직 자기주의에 의존한다.

실험 결과

연구 질문

  • RQ1트랜스포머 기반 아키텍처는 정확한 입술 동기화를 위한 현실적인 3D 얼굴 애니메이션을 위해 장기적인 음성 컨텍스트를 효과적으로 모델링할 수 있는가?
  • RQ2자기학습된 음성 표현은 3D 얼굴 애니메이션에서 데이터가 적은 환경에서 성능을 어떻게 향상시킬 수 있는가?
  • RQ3교차 주의에서 모달 정렬은 음성과 얼굴 운동 간에 어떤 역할을 하는가? 그리고 비밀 메커니즘을 통해 어떻게 향상시킬 수 있는가?
  • RQ4수정된 위치 인코딩 전략은 훈련 중에 관찰하지 못한 더 긴 음성 시퀀스로의 일반화를 향상시킬 수 있는가?
  • RQ5자기주의를 사용한 자기회귀 예측은 반복 모델 대비 운동의 일관성과 입술 동기화 정확도 측면에서 어떻게 비교되는가?

주요 결과

  • FaceFormer는 인간 평가 연구에서 최신 기술을 능가하며, 참가자 57.78%가 기준 모델 대비 더 현실적인 얼굴 애니메이션을 평가했다.
  • 모델은 입술 동기화 성능에서 유의미하게 향상되었으며, 참가자 62.22%가 기준 모델 대비 원래 사인파 위치 인코딩을 사용한 경우보다 입술 운동이 음성과 더 잘 동기화된다고 평가했다.
  • 교차 주의에서 정렬 비밀을 제거하면 얼굴 표정이 둔해지고 비자연스러워지며, 이는 모달 정렬을 위한 비밀의 필요성을 확인한다.
  • 주기적 위치 인코딩(TB+PPE) 전략은 더 긴 음성 시퀀스로의 일반화를 향상시켜, ALiBi나 표준 사인파 인코딩을 사용한 모델에서 관찰되는 시간적 제로점 진동과 정지 동결 문제를 줄였다.
  • 자기주의를 사용한 자기회귀 디코더는 FC 디코더나 LSTM 기반 대안보다 더 시간적으로 일관되고 안정적인 입술 운동을 생성한다.
  • 20초짜리 음성 클립(평균 훈련 길이의 4배 이상)을 사용한 AMT 벤치마크에서 FaceFormer는 고성능 애니메이션을 유지하는 반면, 표준 위치 인코딩을 사용한 모델은 침묵 프레임에서 불안정성을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.