[论文解读] EMAGE: Towards Unified Holistic Co-Speech Gesture Generation via Expressive Masked Audio Gesture Modeling
EMAGE 提出了一套统一的框架,用于生成整体性共话语 gesture,通过利用掩码音频和 gesture 先验,生成包括面部表情、双手、身体和整体运动在内的全身、音频同步动作。通过引入 BEATX 数据集并采用包含四个组成性 VQ-VAE 的掩码音频 gesture 变压器,EMAGE 在 gesture 真实度、多样性和对齐度方面均达到最先进性能,在定量指标和感知评估中均优于先前方法。
We propose EMAGE, a framework to generate full-body human gestures from audio and masked gestures, encompassing facial, local body, hands, and global movements. To achieve this, we first introduce BEAT2 (BEAT-SMPLX-FLAME), a new mesh-level holistic co-speech dataset. BEAT2 combines a MoShed SMPL-X body with FLAME head parameters and further refines the modeling of head, neck, and finger movements, offering a community-standardized, high-quality 3D motion captured dataset. EMAGE leverages masked body gesture priors during training to boost inference performance. It involves a Masked Audio Gesture Transformer, facilitating joint training on audio-to-gesture generation and masked gesture reconstruction to effectively encode audio and body gesture hints. Encoded body hints from masked gestures are then separately employed to generate facial and body movements. Moreover, EMAGE adaptively merges speech features from the audio's rhythm and content and utilizes four compositional VQ-VAEs to enhance the results' fidelity and diversity. Experiments demonstrate that EMAGE generates holistic gestures with state-of-the-art performance and is flexible in accepting predefined spatial-temporal gesture inputs, generating complete, audio-synchronized results. Our code and dataset are available https://pantomatrix.github.io/EMAGE/
研究动机与目标
- 为面部、手部、身体和整体运动的综合共话语 gesture 生成缺乏统一、标准化基准的问题提供解决方案。
- 开发一种框架,能够从部分或掩码的输入中补全时空 gesture 帧,同时保持与音频的同步。
- 通过联合训练音频到 gesture 生成和掩码 gesture 重建任务,提升 gesture 生成的质量和多样性。
- 通过联合训练来自非整体性数据集的多数据集方法,增强在整体性基准上的泛化能力和性能。
- 发布 BEATX,一个社区标准化的、高保真的网格级三维动作数据集,结合 SMPLX 和 FLAME 用于统一的人体动作建模。
提出的方法
- 引入 BEATX,一个全新的网格级整体共话语 gesture 数据集,结合 MoShed SMPLX 身体参数和 FLAME 头部参数,并对头部、颈部和手指运动进行了精细化建模。
- 采用掩码音频 gesture 变压器,通过联合训练音频到 gesture 生成和掩码 gesture 重建任务,以编码音频和身体提示。
- 使用四个独立的 VQ-VAE 分别建模面部、手部、上半身和下半身动作,以提升生成的保真度和多样性。
- 通过内容节奏自注意力(CRA)实现语音节奏和内容特征的自适应融合,以提升语义对齐度和动作质量。
- 在训练过程中利用掩码身体 gesture 提示,指导模型生成合理且与音频同步的全身 gesture。
- 通过为每个数据集分别使用代码本头和 VQ-VAE,实现联合学习 BEATX、Trinity 和 AMASS 的多数据集训练。
实验结果
研究问题
- RQ1统一框架能否通过基于音频和部分 gesture 输入的条件,生成包括面部表情、双手、身体和整体运动在内的全身共话语 gesture?
- RQ2在训练期间引入掩码 gesture 重建如何提升音频同步 gesture 生成的质量和一致性?
- RQ3当在多个非整体性数据集上进行训练时,EMAGE 的泛化能力和性能提升程度如何?
- RQ4与单一统一的 VQ-VAE 相比,为不同身体部位分别使用 VQ-VAE 是否能提升 gesture 的保真度和多样性?
- RQ5EMAGE 在定量指标和人类感知评估中与最先进方法相比表现如何?
主要发现
- 在 BEATX 测试集上,EMAGE 实现了最先进性能,FID 为 5.423,BC 为 6.794,多样性为 13.057,MSE 为 1.180,LVD 为 9.015。
- 与基线相比,引入掩码 gesture 提示使 FGD 降低了 1.376 个点,证明了时空先验在性能提升中的显著作用。
- 与单一 VQ-VAE 相比,使用四个独立的 VQ-VAE 将多样性提高了 4.743 个点,FID 降低了 5.657 个点,表明了模态特定离散先验的优势。
- 内容节奏自注意力(CRA)使 FGD 提升 0.564 个点,并增强了生成 gesture 的语义感知能力。
- 在 Trinity 和 AMASS 等附加数据集上进行训练后,性能进一步提升,FID 降低至 5.174,多样性提升至 14.318(BEATX 测试集)。
- 在 60 名参与者的用户研究中,EMAGE 在感知可信度方面获得 62.5% 的胜率,优于先前的整体方法(如 Talkshow 和 Habibie 等人)。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。