[논문 리뷰] EMAGE: Towards Unified Holistic Co-Speech Gesture Generation via Expressive Masked Audio Gesture Modeling
EMAGE는 얼굴 표정, 손, 몸, 전체 운동을 포함한 전면적인 공말 제스처 생성을 위한 통합 프레임워크를 제안한다. 음성과 제스처 사전 지식을 마스킹하여 전체 신체 운동을 음성에 동기화된 방식으로 생성한다. BEATX 데이터셋을 도입하고, 네 개의 복합 VQ-VAE를 활용한 마스킹된 음성 제스처 트랜스포머를 적용함으로써, 제스처의 정확도, 다양성, 일치도 측면에서 기존 방법을 능가하는 최신 기술 성능을 달성한다. 이는 정량적 지표와 주관적 평가에서 모두 뛰어난 성능을 보인다.
We propose EMAGE, a framework to generate full-body human gestures from audio and masked gestures, encompassing facial, local body, hands, and global movements. To achieve this, we first introduce BEAT2 (BEAT-SMPLX-FLAME), a new mesh-level holistic co-speech dataset. BEAT2 combines a MoShed SMPL-X body with FLAME head parameters and further refines the modeling of head, neck, and finger movements, offering a community-standardized, high-quality 3D motion captured dataset. EMAGE leverages masked body gesture priors during training to boost inference performance. It involves a Masked Audio Gesture Transformer, facilitating joint training on audio-to-gesture generation and masked gesture reconstruction to effectively encode audio and body gesture hints. Encoded body hints from masked gestures are then separately employed to generate facial and body movements. Moreover, EMAGE adaptively merges speech features from the audio's rhythm and content and utilizes four compositional VQ-VAEs to enhance the results' fidelity and diversity. Experiments demonstrate that EMAGE generates holistic gestures with state-of-the-art performance and is flexible in accepting predefined spatial-temporal gesture inputs, generating complete, audio-synchronized results. Our code and dataset are available https://pantomatrix.github.io/EMAGE/
연구 동기 및 목표
- 얼굴, 손, 몸, 전체 운동을 포함한 전면적 공말 제스처 생성을 위한 통합적이고 표준화된 벤치마크의 부재를 해결하기 위해.
- 부분적 또는 마스킹된 입력에서 공간-시간 제스처 프레임을 복원할 수 있는 프레임워크를 개발하여 음성과 동기화된 상태를 유지하기 위해.
- 음성에서 제스처 생성과 마스킹된 제스처 재구성에 동시에 훈련하여 제스처 생성 품질과 다양성을 향상시키기 위해.
- 비전면적 데이터셋을 통합해 다중 데이터셋 훈련을 가능하게 하여 전면적 벤치마크에서의 일반화 능력과 성능을 향상시키기 위해.
- SMPLX와 FLAME을 통합한 공동 표준화된 고해상도 메쉬 수준 3D 운동 데이터셋인 BEATX를 공개하기 위해.
제안 방법
- MoShed된 SMPLX 신체와 FLAME 머리 파rameter를 융합한 새로운 메쉬 수준의 전면적 공말 제스처 데이터셋인 BEATX를 도입하여 머리, 목, 손가락 운동을 정교하게 모델링한다.
- 음성과 신체 힌트를 동시에 인코딩하기 위해 음성-제스처 생성과 마스킹된 제스처 재구성에 동시에 훈련하는 마스킹된 음성 제스처 트랜스포머를 활용한다.
- 얼굴, 손, 상체, 하체 운동을 별도로 모델링하기 위해 네 개의 별도 VQ-VAE를 사용하여 정확도와 다양성을 향상시킨다.
- 내용과 리듬 특징을 적응적으로 융합하기 위해 콘텐츠 리듬 자기주의(Conent Rhythm Self-Attention, CRA)를 적용하여 의미 일치도와 운동 품질을 향상시킨다.
- 훈련 중 마스킹된 신체 제스처 힌트를 활용하여 모델이 타당하고 음성에 동기화된 전면적 제스처를 생성하도록 이끈다.
- 각 데이터셋에 대해 별도의 코드북 헤드와 VQ-VAE를 사용하여 BEATX, Trinity, AMASS 데이터셋을 동시에 학습할 수 있도록 한다.
실험 결과
연구 질문
- RQ1음성과 부분적 제스처 입력을 조건으로 하여 얼굴 표정, 손, 몸, 전체 운동을 포함한 전면적 공말 제스처를 생성할 수 있는가?
- RQ2훈련 중 마스킹된 제스처 재구성은 음성에 동기화된 제스처 생성의 품질과 일관성에 어떤 영향을 미치는가?
- RQ3여러 비전면적 데이터셋에서 훈련할 경우 EMAGE는 얼마나 일반화되고 성능 향상에 기여하는가?
- RQ4다른 신체 부위에 대해 별도의 VQ-VAE를 사용하는 것이 단일 통합 VQ-VAE에 비해 제스처 정확도와 다양성에 기여하는가?
- RQ5정량적 지표와 인간 주관 평가 모두에서 EMAGE는 최신 기술 방법과 비교해 어떤가?
주요 결과
- BEATX 테스트 세트에서 EMAGE는 FGD 5.423, BC 6.794, 다양성 13.057, MSE 1.180, LVD 9.015로 최신 기술 성능을 달성한다.
- 마스킹된 제스처 힌트를 포함시킴으로써 기준 모델 대비 FGD가 1.376점 감소하여 공간-시간 사전 지식의 효과를 입증한다.
- 네 개의 별도 VQ-VAE를 사용할 경우 단일 VQ-VAE에 비해 다양성은 4.743점 향상되고 FGD는 5.657점 감소하여 모odal별 이산 사전 지식의 유용성을 입증한다.
- 콘텐츠 리듬 자기주의(CRA)는 FGD를 0.564점 향상시키며 생성된 제스처의 의미 인식 능력을 향상시킨다.
- Trinity와 AMASS와 같은 추가 데이터셋에서 훈련함으로써 FGD는 5.174로 감소하고 다양성은 BEATX 테스트 세트에서 14.318로 증가하여 성능 향상을 입증한다.
- 60명의 참가자가 참여한 사용자 연구에서 EMAGE는 주관적 신뢰성 평가에서 62.5%의 승률을 기록하여 기존의 전면적 방법인 Talkshow 및 Habibie 등과 비교해 뛰어난 성능을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.