Skip to main content
QUICK REVIEW

[论文解读] DiffuseStyleGesture: Stylized Audio-Driven Co-Speech Gesture Generation with Diffusion Models

Sicheng Yang, Zhiyong Wu|arXiv (Cornell University)|May 8, 2023
Human Motion and Animation被引用 5
一句话总结

DiffuseStyleGesture 提出了一种基于扩散模型的方法,用于音频驱动的共言语手势生成,通过利用 WavLM 音频特征与跨局部注意力及自注意力机制,生成高质量、与语音匹配、具有风格化且多样的手势。该方法通过无分类器指导实现细粒度控制,支持风格插值与初始手势操作,在逼真度与语音适配性方面优于先前方法。

ABSTRACT

The art of communication beyond speech there are gestures. The automatic co-speech gesture generation draws much attention in computer animation. It is a challenging task due to the diversity of gestures and the difficulty of matching the rhythm and semantics of the gesture to the corresponding speech. To address these problems, we present DiffuseStyleGesture, a diffusion model based speech-driven gesture generation approach. It generates high-quality, speech-matched, stylized, and diverse co-speech gestures based on given speeches of arbitrary length. Specifically, we introduce cross-local attention and self-attention to the gesture diffusion pipeline to generate better speech matched and realistic gestures. We then train our model with classifier-free guidance to control the gesture style by interpolation or extrapolation. Additionally, we improve the diversity of generated gestures with different initial gestures and noise. Extensive experiments show that our method outperforms recent approaches on speech-driven gesture generation. Our code, pre-trained models, and demos are available at https://github.com/YoungSeng/DiffuseStyleGesture.

研究动机与目标

  • 为解决生成多样、逼真且与语音对齐的共言语手势的挑战,使其匹配语音的节奏与语义。
  • 克服 GAN、VAE 与基于流的模型在手势生成中的局限性,特别是模式崩溃与质量-多样性权衡问题。
  • 通过无分类器指导实现可控制的手势生成,支持风格插值与初始手势控制。
  • 通过捕捉局部与全局依赖关系的注意力机制,提升语音与手势之间的时序对齐。
  • 通过引入 WavLM 音频特征中的语义与情感信息,提升模型的鲁棒性与泛化能力。

提出的方法

  • 该模型采用基于音频(通过 WavLM 特征表示)、初始手势与风格嵌入条件的去噪扩散过程,生成时序对齐的手势。
  • 使用跨局部注意力捕捉语音与手势特征之间的短程相关性,提升局部同步性。
  • 应用自注意力机制建模长程时序依赖,支持任意长度语音输入的手势生成。
  • 通过训练期间使用随机掩码实现无分类器指导,支持风格与初始手势条件的插值与外推。
  • 模型直接预测去噪后的手势序列,而非噪声,从而提升训练稳定性与生成质量。
  • 通过迭代去噪学习数据分布,架构设计结合注意力机制,增强语音与手势的对齐效果。

实验结果

研究问题

  • RQ1扩散模型能否有效生成针对任意长度音频输入的多样、高质量且与语音匹配的共言语手势?
  • RQ2跨局部注意力与自注意力机制在提升语音与手势序列时序对齐方面发挥何种作用?
  • RQ3无分类器指导在多大程度上支持手势生成中的可控制风格编辑与初始手势操作?
  • RQ4与传统音频特征(如 MFCC)相比,引入 WavLM 特征是否能提升手势生成的质量与鲁棒性?
  • RQ5为何前向注意力会降低性能?这对手势生成的时序动力学特性有何启示?

主要发现

  • 完整版 DiffuseStyleGesture 模型在逼真度评分上达到 4.11 ± 0.08,语音适配性评分达到 4.11 ± 0.10,显著优于消融模型。
  • 移除 WavLM 特征后,语音适配性下降至 3.91 ± 0.11,表明语义与情感音频特征对对齐至关重要。
  • 移除跨局部注意力导致性能急剧下降(逼真度:3.76 ± 0.09,适配性:3.51 ± 0.15),证明其在局部语音-手势同步中的关键作用。
  • 移除自注意力导致性能最差(逼真度:3.55 ± 0.13,适配性:3.08 ± 0.10),凸显其在建模长程依赖中的核心作用。
  • 用基于 GRU 的建模替代注意力机制后,得分最低(3.10 ± 0.11 与 2.98 ± 0.14),证实注意力机制在此任务中的优越性。
  • 前向注意力性能劣于跨局部注意力,表明手势主要受当前与过去语音影响,而非未来语音,与人类运动规划机制一致。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。