[論文レビュー] EMAGE: Towards Unified Holistic Co-Speech Gesture Generation via Expressive Masked Audio Gesture Modeling
EMAGEは、音声とジェスチャーのマスク処理を活用した統合的フレームワークを提案し、顔面の筋肉、手、体幹、全身の動きを含む、全身にわたる音声同期ジェスチャー生成を実現する。BEATXデータセットを導入し、4つの構成的VQ-VAEを用いたマスク音声ジェスチャー変換器を採用することで、ジェスチャーの正確性、多様性、同期性において最先端の性能を達成し、定量的指標および人的評価の両面で先行手法を上回った。
We propose EMAGE, a framework to generate full-body human gestures from audio and masked gestures, encompassing facial, local body, hands, and global movements. To achieve this, we first introduce BEAT2 (BEAT-SMPLX-FLAME), a new mesh-level holistic co-speech dataset. BEAT2 combines a MoShed SMPL-X body with FLAME head parameters and further refines the modeling of head, neck, and finger movements, offering a community-standardized, high-quality 3D motion captured dataset. EMAGE leverages masked body gesture priors during training to boost inference performance. It involves a Masked Audio Gesture Transformer, facilitating joint training on audio-to-gesture generation and masked gesture reconstruction to effectively encode audio and body gesture hints. Encoded body hints from masked gestures are then separately employed to generate facial and body movements. Moreover, EMAGE adaptively merges speech features from the audio's rhythm and content and utilizes four compositional VQ-VAEs to enhance the results' fidelity and diversity. Experiments demonstrate that EMAGE generates holistic gestures with state-of-the-art performance and is flexible in accepting predefined spatial-temporal gesture inputs, generating complete, audio-synchronized results. Our code and dataset are available https://pantomatrix.github.io/EMAGE/
研究の動機と目的
- 顔面、手、体幹、全身の動きを含む、包括的共話ジェスチャー生成のための統合的かつ標準化されたベンチマークの欠如に対処すること。
- 部分的またはマスクされた入力から、音声と同期した空間的・時間的ジェスチャーのフレームを補完できるフレームワークの開発。
- 音声からジェスチャーへの変換とマスクされたジェスチャー再構築を同時に学習することで、ジェスチャー生成の質と多様性を向上させること。
- 非包括的データセットを用いた複数データセット学習を可能にし、包括的ベンチマークにおける汎化性と性能を向上させること。
- SMPLXとFLAMEを統合した、コミュニティ標準の高精細メッシュレベル3次元モーションドメインであるBEATXをリリースすること。
提案手法
- MoShedされたSMPLXボディとFLAMEヘッドパラメータを統合した、メッシュレベルの包括的共話ジェスチャーデータセットBEATXを導入。頭部、首、指の動きを精緻にモデリング。
- 音声とボディーヒントを統合的にエンコードするため、音声からジェスチャー生成とマスクされたジェスチャー再構築の両方を学習するマスク音声ジェスチャー変換器を採用。
- 顔面、手、上半身、下半身の動きを個別にモデリングする4つの別々のVQ-VAEを用い、忠実度と多様性を向上。
- コンテンツとリズム特徴を適応的に統合するため、コンテンツ・リズム自己注意(CRA)を導入し、意味的整合性と動きの質を向上。
- 訓練中にマスクされたボディジェスチャーのヒントを活用し、音声と同期した妥当な全身ジェスチャーの生成をモデルがガイド可能に。
- 各データセットごとに別々のコードブックヘッドとVQ-VAEを用いることで、BEATX、Trinity、AMASSの複数データセット学習を可能に。
実験結果
リサーチクエスチョン
- RQ1音声と部分的なジェスチャー入力に条件づけた統合的フレームワークは、顔面の筋肉、手、体幹、全身の動きを含む全身共話ジェスチャーを生成できるか?
- RQ2訓練時のマスクジェスチャー再構築は、音声と同期したジェスチャー生成の質と一貫性をどのように向上させるか?
- RQ3複数の非包括的データセットで学習した場合、EMAGEはどの程度一般化され、性能が向上するか?
- RQ4異なる身体部位に別々のVQ-VAEを用いることで、単一の統合VQ-VAEと比較してジェスチャーの忠実度と多様性が向上するか?
- RQ5定量的指標および人的評価の両面で、EMAGEは最先端の手法と比較してどの程度優れているか?
主な発見
- BEATXテストセットにおいて、FGDが5.423、BCが6.794、多様性が13.057、MSEが1.180、LVDが9.015という最先端の性能を達成。
- マスクジェスチャーのヒントを組み込むことで、ベースラインと比較してFGDが1.376ポイント低下し、空間的・時間的事前知識の有効性を示した。
- 4つの別々のVQ-VAEを用いることで、多様性が4.743ポイント向上し、FGDが5.657ポイント低下し、モダリティに特化した離散的事前知識の利点を実証。
- コンテンツ・リズム自己注意(CRA)を用いることで、FGDが0.564ポイント改善され、生成ジェスチャーの意味的認識が向上。
- TrinityやAMASSなどの追加データセットで学習することで、FGDが5.174に低下し、多様性が14.318に上昇、BEATXテストセットでさらなる性能向上を達成。
- 60名の参加者を対象としたユーザースタディでは、EMAGEは人的評価の信憑性で62.5%の勝率を記録し、Talkshow や Habibie et al. といった先行包括的手法を上回った。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。