[论文解读] Taming Diffusion Models for Audio-Driven Co-Speech Gesture Generation
本文提出 DiffGesture,一种基于扩散模型的音频驱动协同手势生成框架,通过扩散音频-手势 Transformer 模elling 跨模态音频-手势依赖关系,并通过扩散手势稳定器确保时间一致性。通过引入隐式分类器自由指导,该方法在基准数据集上实现了最先进性能,显著提升了生成结果的多样性、音频相关性与手势质量。
Animating virtual avatars to make co-speech gestures facilitates various applications in human-machine interaction. The existing methods mainly rely on generative adversarial networks (GANs), which typically suffer from notorious mode collapse and unstable training, thus making it difficult to learn accurate audio-gesture joint distributions. In this work, we propose a novel diffusion-based framework, named Diffusion Co-Speech Gesture (DiffGesture), to effectively capture the cross-modal audio-to-gesture associations and preserve temporal coherence for high-fidelity audio-driven co-speech gesture generation. Specifically, we first establish the diffusion-conditional generation process on clips of skeleton sequences and audio to enable the whole framework. Then, a novel Diffusion Audio-Gesture Transformer is devised to better attend to the information from multiple modalities and model the long-term temporal dependency. Moreover, to eliminate temporal inconsistency, we propose an effective Diffusion Gesture Stabilizer with an annealed noise sampling strategy. Benefiting from the architectural advantages of diffusion models, we further incorporate implicit classifier-free guidance to trade off between diversity and gesture quality. Extensive experiments demonstrate that DiffGesture achieves state-of-theart performance, which renders coherent gestures with better mode coverage and stronger audio correlations. Code is available at https://github.com/Advocate99/DiffGesture.
研究动机与目标
- 为解决基于 GAN 的方法在音频驱动手势生成中存在模式崩溃与训练不稳定等局限性。
- 将扩散模型(通常用于静态数据)适配至生成时间一致、高保真的手势序列,且以连续音频片段为条件。
- 通过建模音频与骨骼序列之间的长期时间依赖关系,提升语音与手势之间的跨模态对齐。
- 消除标准扩散推理中因 i.i.d. 噪声采样导致的时间不一致性问题。
- 通过隐式分类器自由指导实现生成多样性与质量之间的可控权衡。
提出的方法
- 将手势生成任务建模为在骨骼序列与音频片段上的条件扩散过程,通过逐步添加噪声并利用音频条件上下文特征进行去噪。
- 设计了扩散音频-手势 Transformer 模块,将逐帧的骨骼特征与音频特征沿时间维度拼接,并通过 Transformer 编码器处理,以建模长程依赖关系。
- 引入扩散手势稳定器模块,采用渐进式噪声采样策略,降低时间不一致性,提升动作平滑度。
- 通过联合训练条件与无条件扩散模型,实现隐式分类器自由指导,从而在推理阶段灵活调节多样性与保真度之间的权衡。
- 采用非自回归生成流程,避免误差累积,实现高效、端到端的完整手势片段合成。
- 在大规模语音-手势数据集上端到端训练模型,同时利用 TED Gesture 与 TED Expressive 基准数据集。
实验结果
研究问题
- RQ1扩散模型能否有效生成高保真、时间一致的协同手势,且以连续音频输入为条件?
- RQ2在序列到序列生成框架中,如何有效建模跨模态音频-手势依赖关系?
- RQ3何种机制可稳定扩散过程,防止生成骨骼序列中的时间不一致性?
- RQ4隐式分类器自由指导在多大程度上可改善手势生成中多样性与质量的平衡?
- RQ5与基于 GAN 的基线方法相比,所提框架在模式覆盖、音频相关性与感知质量方面表现如何?
主要发现
- DiffGesture 在 TED Gesture 与 TED Expressive 数据集上均达到最先进性能,在所有关键指标上均优于先前基于 GAN 的方法。
- 在 TED Gesture 数据集上,模型取得 1.506 的 Fréchet Gesture Distance(FGD)分数,在次优基线中显著领先。
- 在 TED Expressive 数据集上,边界覆盖(BC)得分为 0.718,表明模式覆盖能力强,且模式崩溃现象显著减少。
- 在 TED Expressive 数据集上,多样性指标达到 182.757,展现出生成多样化且富有表现力手势的优越能力。
- 用户研究结果显示,人类评估者对 DiffGesture 的自然度、平滑度与同步性评分均值为 4.5(满分 5 分),表明其具有极高的感知质量。
- 消融实验证实,扩散手势稳定器与隐式分类器自由指导均为实现高性能所必需,移除任一模块均导致 FGD 与 BC 显著下降。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。