[논문 리뷰] MeshTalk: 3D Face Animation from Speech using Cross-Modality Disentanglement
MeshTalk는 카테고리형 잠재공간과 새로운 교차 모odal 손실을 사용하여 음성에 관련된(예: 입술 움직임) 및 음성에 관련되지 않은(예: 깜빡임, 눈썹 움직임) 얼굴 운동을 분리하는 일반적인 음성 주도 3D 얼굴 애니메이션 방법을 제안한다. 이는 실사성과 입술 동기화 정확도에서 최신 기술 수준(SOTA)을 달성하며, 인식 연구 참가자 중 75%가 SOTA 기준선보다 MeshTalk을 선호한다.
This paper presents a generic method for generating full facial 3D animation from speech. Existing approaches to audio-driven facial animation exhibit uncanny or static upper face animation, fail to produce accurate and plausible co-articulation or rely on person-specific models that limit their scalability. To improve upon existing models, we propose a generic audio-driven facial animation approach that achieves highly realistic motion synthesis results for the entire face. At the core of our approach is a categorical latent space for facial animation that disentangles audio-correlated and audio-uncorrelated information based on a novel cross-modality loss. Our approach ensures highly accurate lip motion, while also synthesizing plausible animation of the parts of the face that are uncorrelated to the audio signal, such as eye blinks and eye brow motion. We demonstrate that our approach outperforms several baselines and obtains state-of-the-art quality both qualitatively and quantitatively. A perceptual user study demonstrates that our approach is deemed more realistic than the current state-of-the-art in over 75% of cases. We recommend watching the supplemental video before reading the paper: https://github.com/facebookresearch/meshtalk
연구 동기 및 목표
- 비음성 관련 얼굴 역동성(예: 상부 얼굴의 정적 또는 이상스러운 움직임)을 충분히 모델링하지 못하는 기존 음성 주도 3D 얼굴 애니메이션 방법의 한계를 해결하기 위해.
- 음성 주도 애니메이션에서 발생하는 일대다 매핑 문제를 음성 관련 및 음성 관련이 아닌 얼굴 운동 성분을 분리함으로써 해결하기 위해.
- 개인별 훈련 데이터나 고정밀 운동 캡처가 필요 없이도 일반적이고 신원에 관계없는 3D 얼굴 애니메이션을 가능하게 하기 위해.
- 음성 입력과 무관하게 자연스럽고 다양한 상부 얼굴 운동(예: 깜빡임, 눈썹 올리기)을 모델링하여 인지적 현실감과 공조 운동을 향상시키기 위해.
- 잠재 표현을 분리하고 재사용 가능한 방식으로 학습함으로써 재타겟팅과 메시 드빙 같은 실용적 응용을 지원하기 위해.
제안 방법
- 음성에 관련된(예: 입 모양) 및 음성에 관련되지 않은(예: 눈 깜빡임) 얼굴 운동 성분을 명시적으로 분리하는 카테고리형 잠재공간을 도입한다.
- 음성 입력과 무관하게 상부 얼굴 운동을 정확히 재구성하고, 오직 음성에 조건화된 정확한 입술 운동을 유도하는 새로운 교차 모달 손실을 활용한다.
- 학습된 잠재공간을 기반으로 자동회귀적 샘플링 전략을 적용하여 음성에서 시간적으로 일관되고 고해상도의 3D 얼굴 애니메이션을 생성한다.
- 단일 중립 3D 얼굴 스캔과 음성 입력만을 사용하여 신원 특화 정밀조정 없이도 전체 얼굴 애니메이션을 생성한다.
- 원본 신원의 애니메이션 메시에서 얻은 잠재 코드를 대상 신원의 중립 템플릿 메시로 매핑함으로써 재타겟팅과 메시 드빙을 가능하게 한다.
- 음성과 3D 메시 시퀀스의 쌍을 사용해 종합적으로 훈련하며, 분리와 모달별 정확도를 촉진하는 손실 함수를 적용한다.
실험 결과
연구 질문
- RQ1분리된 잠재공간이 음성 의존적 및 음성 비의존적 얼굴 운동을 분리함으로써 음성 주도 3D 얼굴 애니메이션의 현실감을 향상시킬 수 있는가?
- RQ2입술 운동의 정확성을 보장하면서도 깜빡임, 눈썹 움직임 등의 자연스럽고 다양한 상부 얼굴 운동을 유지할 수 있도록 교차 모달 손실을 어떻게 설계할 수 있는가?
- RQ3일반적이고 신원에 관계없는 모델이 새로운 신원에 대해 얼마나 뛰어난 현실감과 일반화 능력을 보일 수 있는가?
- RQ4분리된 잠재 표현이 재타겟팅과 언어에 관계없는 메시 드빙 같은 실용적 응용을 지원할 수 있는가?
- RQ5사용자 연구에서 제안된 방법이 최신 기술 수준 기준선보다 뛰어난 인지적 품질을 달성하는가?
주요 결과
- 인지 사용자 연구에서 MeshTalk는 현재 최신 기술 수준 기준선(VOCA)보다 75%의 경우에서 선호되었으며, 66.4%의 경우에서 엄격히 선호되었고, 지표보다 낮게 평가된 경우는 42.1%에 불과했다.
- 정량적 지표와 시각적 점검을 통해 음성 입력과 정확히 일치하는 매우 정확한 입술 운동을 달성했다.
- 음성 자극이 없더라도 음성 입력에서 분리된 덕분에 눈 깜빡임, 눈썹 올리기 등의 상부 얼굴 운동이 자연스럽고 현실적으로 다양하게 표현된다.
- 분리된 잠재공간 덕분에 한 신원의 애니메이션을 다른 신원으로 성공적으로 재타겟팅할 수 있었으며, 운동 품질과 신원에 관계없는 운동 패tern을 유지했다.
- 기존 언어의 음성으로 입 모양을 재생산하면서 원래의 상부 얼굴 운동을 유지함으로써 메시 드빙이 성공적으로 구현되었으며, 이는 모달 분리가 언어에 관계없는 애니메이션을 가능하게 한다는 것을 증명한다.
- 정성적 및 정량적 평가에서 여러 기준선을 능가하여 음성 주도 3D 얼굴 애니메이션 분야에서 새로운 최신 기술 수준을 수립했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.