Skip to main content
QUICK REVIEW

[논문 리뷰] Audio2Face: Generating Speech/Face Animation from Single Audio with Attention-Based Bidirectional LSTM Networks

Guanzhong Tian, Yi Yuan|arXiv (Cornell University)|2019. 05. 27.
Face recognition and analysis참고 문헌 15인용 수 5
한 줄 요약

이 논문은 주어진 단일 오디오 입력에서 직접 입술 움직임과 자발적인 표정을 포함한 현실적인 3D 얼굴 애니메이션을 생성하는 엔드 투 엔드 딥 러닝 프레임워크인 Audio2Face를 제안한다. 주목적 기반 양방향 LSTM 네트워크를 사용하여, 메르 주파수 체프스트랄 계수(MFCCs)에서 유도된 시간적 의존성과 주목적 가중치를 부여한 음향 특징을 학습한다. 이 모델은 낮은 지연 시간을 기록하여 실시간 애니메이션을 가능하게 하며, 최신 기술 수준의 성능을 달성한다.

ABSTRACT

We propose an end to end deep learning approach for generating real-time facial animation from just audio. Specifically, our deep architecture employs deep bidirectional long short-term memory network and attention mechanism to discover the latent representations of time-varying contextual information within the speech and recognize the significance of different information contributed to certain face status. Therefore, our model is able to drive different levels of facial movements at inference and automatically keep up with the corresponding pitch and latent speaking style in the input audio, with no assumption or further human intervention. Evaluation results show that our method could not only generate accurate lip movements from audio, but also successfully regress the speaker's time-varying facial movements.

연구 동기 및 목표

  • 비디오, 이미지 또는 수동 조작 없이 오디오만으로도 고해상도의 얼굴 애니메이션을 생성하는 실시간 엔드 투 엔드 시스템을 개발하는 것.
  • 복잡하고 시간에 따라 변화하는 얼굴 운동을 음성 입력에 매핑하는 도전 과제를 해결하는 것. 이는 장거리 의존성과 비선형 매핑을 수반한다.
  • 말하기의 정서적 상태와 발음 상태와 관련된 잠재 표현을 학습하여 입술 움직임과 자발적인 얼굴 표정을 모두 모델링하는 것.
  • 학습 후 새로운 3D 얼굴 기하 구조로의 리타겟팅이 가능하도록 하여 다양한 얼굴 모델 간 일반화를 보장하는 것.
  • 상호작용 애플리케이션에 배포하기 위해 추론 속도를 최적화하여 엄격한 실시간 제약 조건을 충족하는 것.

제안 방법

  • 입력은 수동으로 생성된 메르 주파수 체프스트랄 계수(MFCCs)로 변환된 원시 오디오이며, 주요 음향 특징으로 기능한다.
  • 양방향 LSTM 네트워크가 순차적인 MFCCs를 처리하여 양방향으로 시간적 의존성과 맥락 정보를 포착한다.
  • 각 시간 단계에서 다양한 음향 특징의 중요도를 동적으로 가중치를 매기기 위해 주목적 메커니즘이 LSTM 레이어에 통합된다. 이는 음성과 얼굴 운동 간의 정렬을 향상시킨다.
  • 출력은 3D 모어포블 얼굴 모델의 블렌드쉐이프 파라미터 시퀀스이며, 입술 자국과 자발적인 표정을 포함한 현실적인 얼굴 변형을 이끈다.
  • 전체 프레임워크는 예측된 블렌드쉐이프 파라미터와 진짜 값 간의 평균 제곱 오차(MSE) 손실을 사용하여 엔드 투 엔드로 학습된다.
  • 추론은 실시간 성능 향상을 위해 최적화되었으며, 평균적으로 오디오 윈도우당 0.68ms(33.3ms 프레임 레이트)의 처리 시간을 기록하여 실시간 애니메이션을 가능하게 한다.

실험 결과

연구 질문

  • RQ1딥 러닝 모델이 시각적 또는 보조 입력 없이 오디오만으로 정확하고 자연스러운 얼굴 애니메이션을 생성할 수 있는가?
  • RQ2주목적 기반 양방향 LSTM은 다양한 말하기 스타일과 음역대에서 음성 특징과 얼굴 운동 간의 복잡하고 비선형적인 매핑을 얼마나 효과적으로 학습할 수 있는가?
  • RQ3기본 RNN이나 HMM에 비해 주목적 메커니즘이 시간적 정렬과 얼굴 세부 사항 생성에 얼마나 향상된 성능을 보이는가?
  • RQ4학습된 모델이 리타겟팅을 통해 새로운 3D 얼굴 모델로 일반화될 수 있으며, 얼굴 표정의 정밀도를 유지할 수 있는가?
  • RQ5모델의 추론 지연 시간은 얼마이며, 가상 에이전트나 화상 회의와 같은 실시간 애플리케이션을 지원할 수 있는가?

주요 결과

  • 제안된 방법은 HMM 및 표준 LSTM 베이스라인에 비해 모든 테스트 세트에서 가장 낮은 RMSE를 기록했으며, 평균 지표에서 512개의 노드를 사용할 경우 RMSE가 0.2883로, 블렌드쉐이프 파라미터 예측 정확도가 뛰어나다는 것을 나타낸다.
  • 512노드 모델은 더 작은 아키텍처에 비해 얼굴 애니메이션 작업에서 더 뛰어난 성능을 보이며, 복잡하고 전체 얼굴 운동 생성에 더 높은 용량이 필요하다는 것을 시사한다.
  • 학습 후 다른 캐릭터로의 리타겟팅이 성공적으로 수행되었으며, 얼굴 운동 일관성이 유지됨으로써 새로운 얼굴 모델로의 일반화 능력이 뛰어나다는 것이 입증되었다.
  • 추론은 평균적으로 오디오 윈도우당 0.68ms(33.3ms 프레임 레이트)로 실행되어 실시간 기능이 가능함을 확인했다.
  • 모델은 입술 움직임과 자발적인 얼굴 표정을 모두 회귀성 예측에 성공했지만, 눈 깜빡임 패tern은 음성과 상관관계가 없어 예측하지 못했다.
  • 정성적 결과는 실제와 유사하고 자연스러운 얼굴 애니메이션을 보여주며, 특히 입모양 일치와 동적인 얼굴 표정에서 뛰어난 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.