[论文解读] DiffMotion: Speech-Driven Gesture Synthesis Using Denoising Diffusion Model
本文提出 DiffMotion,一种基于扩散模型的生成模型,用于语音驱动的3D手势生成,采用自回归时间编码器和去噪扩散模块,以学习语音与手势之间复杂的、一对多映射关系。该方法生成多样、自然且节奏同步的手势,在客观和主观评估中均优于最先进基线模型,人类评分几乎与真实动作捕捉数据相当。
Speech-driven gesture synthesis is a field of growing interest in virtual human creation. However, a critical challenge is the inherent intricate one-to-many mapping between speech and gestures. Previous studies have explored and achieved significant progress with generative models. Notwithstanding, most synthetic gestures are still vastly less natural. This paper presents DiffMotion, a novel speech-driven gesture synthesis architecture based on diffusion models. The model comprises an autoregressive temporal encoder and a denoising diffusion probability Module. The encoder extracts the temporal context of the speech input and historical gestures. The diffusion module learns a parameterized Markov chain to gradually convert a simple distribution into a complex distribution and generates the gestures according to the accompanied speech. Compared with baselines, objective and subjective evaluations confirm that our approach can produce natural and diverse gesticulation and demonstrate the benefits of diffusion-based models on speech-driven gesture synthesis.
研究动机与目标
- 解决虚拟人动画中语音与手势之间固有的多对多映射挑战。
- 在确定性或自编码器模型之外,提升语音驱动手势生成的自然度与多样性。
- 探索扩散模型在跨模态手势生成中的潜力,该领域此前对扩散模型的应用较为有限。
- 开发一种完全端到端、弱监督的框架,无需人工手势标注。
- 生成高质量、时间连贯且富有表现力的手势,与语音节奏和语义相匹配。
提出的方法
- 自回归时间编码器处理序列语音和历史手势特征,以捕捉长程时间依赖关系。
- 去噪扩散概率模型通过逐步去除噪声,将潜在表示从高斯噪声还原为真实3D手势序列。
- 扩散模块以语音嵌入和先前手势状态为条件,实现多样化输出的条件生成。
- 通过变分下界优化进行训练,以最小化重建误差并提升生成样本质量。
- 该架构支持在未经结构化、原始动作捕捉数据上进行端到端训练,无需人工标注。
- 推理过程涉及反向去噪步骤,通过调整扩散步数超参数以平衡质量与速度。

实验结果
研究问题
- RQ1基于扩散模型能否有效学习语音与手势之间复杂的一对多映射关系?
- RQ2与现有生成模型(如GAN、VAE、归一化流)相比,所提出的DiffMotion在生成多样且自然手势方面表现如何?
- RQ3扩散步数对手势质量、多样性及推理速度有何影响?
- RQ4即使在训练数据中未出现,模型能否生成既真实又与语音节奏同步的手势?
- RQ5在人类评估中,模型性能在多大程度上匹配或接近真实动作捕捉数据?
主要发现
- DiffMotion 的人类相似度得分为 3.89 ± 0.95,几乎与真实动作捕捉数据(3.89 ± 0.93)相当,表明其具有高度的感知真实感。
- 在适当性评估中,模型得分为 3.93 ± 0.93,表明手势与语音内容高度一致。
- 在多样性评估中,DiffMotion(3.91 ± 0.96)显著优于真实数据(3.60 ± 1.02),生成的手势多样性高于数据集中实际存在的手势。
- 最优扩散步数确定为 100,实现了运动连贯性与推理效率的平衡。
- 当步数超过 N=1000 时,推理时间显著增加,且因细节过度平滑而偶尔生成怪异姿态。
- 在 N=2500 时,模型达到验证损失 0.10,但每帧推理时间达 8.02 秒,凸显了质量与速度之间的权衡。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。