Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Audio-Driven Viseme Dynamics for 3D Face Animation

Linchao Bao, Haoxian Zhang|arXiv (Cornell University)|2023. 01. 15.
Face recognition and analysis인용 수 5
한 줄 요약

이 논문은 음성 영상에서 발음 기반 추적과 딥 뉴럴 오디오-비세임 곡선 매핑 네트워크를 사용하여 비세임 동역학을 학습하는 오디오 기반 3D 얼굴 애니메이션 시스템을 제안한다. 이 방법은 다양한 캐릭터에 적용 가능하며 오디오 왜곡에 강건한 다국어 입력을 지원하는 현실적이고 애니메이터 友好的한 입모양 동기화 애니메이션을 생성한다.

ABSTRACT

We present a novel audio-driven facial animation approach that can generate realistic lip-synchronized 3D facial animations from the input audio. Our approach learns viseme dynamics from speech videos, produces animator-friendly viseme curves, and supports multilingual speech inputs. The core of our approach is a novel parametric viseme fitting algorithm that utilizes phoneme priors to extract viseme parameters from speech videos. With the guidance of phonemes, the extracted viseme curves can better correlate with phonemes, thus more controllable and friendly to animators. To support multilingual speech inputs and generalizability to unseen voices, we take advantage of deep audio feature models pretrained on multiple languages to learn the mapping from audio to viseme curves. Our audio-to-curves mapping achieves state-of-the-art performance even when the input audio suffers from distortions of volume, pitch, speed, or noise. Lastly, a viseme scanning approach for acquiring high-fidelity viseme assets is presented for efficient speech animation production. We show that the predicted viseme curves can be applied to different viseme-rigged characters to yield various personalized animations with realistic and natural facial motions. Our approach is artist-friendly and can be easily integrated into typical animation production workflows including blendshape or bone based animation.

연구 동기 및 목표

  • 자원이 제한되거나 전문가가 아닌 제작 환경에서도 오디오만으로 현실적인 입모양 동기화 3D 얼굴 애니메이션을 생성하는 데 도전하는 것.
  • 원시 메esh 정점 대신 비세임 가중치 곡선으로 애니메이션을 모델링하여 제어성과 예술가 친화성을 향상시키는 것.
  • 강건한 오디오-비세임 곡선 매핑 모델을 통해 예측되지 않은 목소리와 다국어 음성 입력으로의 일반화를 가능하게 하는 것.
  • 실제 연기자로부터 고해상도 비세임 자산을 확보하기 위한 비세임 스캐닝 파이프라인을 도입하여 효율적인 제작 워크플로우를 지원하는 것.

제안 방법

  • 발음 사전을 활용해 비세임 가중치 곡선을 음성 영상에서 추출하는 새로운 발음 기반 얼굴 추적 알고리즘을 제안하여 발음과의 상관관계를 향상시킴.
  • 다국어 사전 학습된 모델에서 유도된 원시 오디오 특징을 비세임 가중치 곡선으로 매핑하는 딥 뉴럴 네트워크를 훈련시켜 오디오-애니메이션 곡선 예측을 가능하게 함.
  • 시퀀스 모델링을 위해 잔차 연결을 갖춘 시간적 컨volution 네트워크(TCN)를 오디오-곡선 매핑 모델의 백본으로 사용함.
  • 비교 및 분석을 위해 트랜스포머 기반 디코더를 통합하여 일반화 성능과 강건성을 입증함.
  • 변형 전달과 SSDR 기반 뼈 자세 변환을 통해 블렌드쉐이프 및 뼈 기반 애니메이션 파이프라인 양쪽 모두를 지원하는 비세임 곡선 리타겟팅을 적용함.
  • 실제 연기자로부터 고해상도 비세임 자산을 캡처하기 위한 비세임 스캐닝 절차를 개발하여 새로운 캐릭터를 위한 개인화된 애니메이션을 가능하게 함.

실험 결과

연구 질문

  • RQ1비디오에서 발음 기반 비세임 곡선 추출이 비세임 가중치와 발음 간의 상관관계를 향상시켜 애니메이터 제어를 더 예측 가능하게 하고 친화적으로 만들 수 있는가?
  • RQ2학습된 오디오-비세임 곡선 매핑 모델이 예측되지 않은 화자와 다국어 음성 입력으로 얼마나 잘 일반화되는가?
  • RQ3기존 오디오 기반 얼굴 애니메이션 기법 대비 제안된 방법이 현실성과 자연스러움 측면에서 얼마나 뛰어나게 성능을 내는가?
  • RQ4같은 예측된 비세임 곡선이 다양한 얼굴 라이팅 또는 스타일을 가진 다른 3D 캐릭터에 효과적으로 재사용 가능한가?
  • RQ5볼륨 변화, 톤 이동, 배경 잡음 등의 오디오 왜곡에 대해 시스템은 얼마나 강건한가?

주요 결과

  • 제안된 발음 기반 비세임 피팅 알고리즘이 비세임 가중치와 발음 간의 상관관계를 크게 향상시켜 더 예측 가능하고 예술가 친화적인 애니메이션 곡선을 생성함.
  • 오디오-곡선 매핑 모델은 오디오 왜곡(톤, 볼륨, 속도 변화 포함)이 있는 상황에서도 입모양 동기화 정확도와 자연스러움 측면에서 최신 기술 성능을 달성함.
  • 예측된 동일한 비세임 곡선은 다양한 비세임 라이팅이 적용된 3D 캐릭터에 성공적으로 적용되어 현실적이고 개인화된 애니메이션을 생성함.
  • 다국어 사전 학습된 오디오 특징의 사용 덕분에 다국어 음성 입력을 지원하여 예측되지 않은 언어와 목소리로의 일반화가 가능함.
  • 비세임 스캐닝 파이프라인이 고해상도 비세임 자산을 효율적으로 확보할 수 있게 해주어 디지털 인간과 스타일리시한 캐릭터의 제작을 간소화함.
  • 이 방법은 블렌드쉐이프 및 뼈 기반 애니메이션 파이프라인 양쪽 모두와 호환되어 유니티 및 언리얼 엔진과 같은 실시간 엔진 내 기존 애니메이션 워크플로우에 원활하게 통합됨.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.