Skip to main content
QUICK REVIEW

[论文解读] Listen, Denoise, Action! Audio-Driven Motion Synthesis with Diffusion Models

Simon Alexanderson, Rajmund Nagy|arXiv (Cornell University)|Nov 17, 2022
Music Technology and Sound Studies被引用 6
一句话总结

本文提出了一种基于扩散模型的音频驱动3D人体动作生成框架,采用Conformer架构建模复杂动作序列,并利用无分类器指导实现风格控制。该方法在手势和舞蹈生成任务中实现了最先进水平的动作质量,具备可控的风格表达能力,并提出了一种新型的专家集成方法以实现插值与模型融合。

ABSTRACT

Diffusion models have experienced a surge of interest as highly expressive yet efficiently trainable probabilistic models. We show that these models are an excellent fit for synthesising human motion that co-occurs with audio, e.g., dancing and co-speech gesticulation, since motion is complex and highly ambiguous given audio, calling for a probabilistic description. Specifically, we adapt the DiffWave architecture to model 3D pose sequences, putting Conformers in place of dilated convolutions for improved modelling power. We also demonstrate control over motion style, using classifier-free guidance to adjust the strength of the stylistic expression. Experiments on gesture and dance generation confirm that the proposed method achieves top-of-the-line motion quality, with distinctive styles whose expression can be made more or less pronounced. We also synthesise path-driven locomotion using the same model architecture. Finally, we generalise the guidance procedure to obtain product-of-expert ensembles of diffusion models and demonstrate how these may be used for, e.g., style interpolation, a contribution we believe is of independent interest. See https://www.speech.kth.se/research/listen-denoise-action/ for video examples, data, and code.

研究动机与目标

  • 为解决从音频生成高质量、多样化且具有风格表达的3D人体动作的挑战,特别是在舞蹈和共言语手势等动作高度模糊且个体化的情境下。
  • 开发一种概率生成模型,以捕捉音频驱动动作的复杂非确定性特性,克服确定性或非概率方法的局限性。
  • 通过无分类器指导调整风格表达强度,实现可控的动作生成。
  • 将指导机制推广至多模型集成,实现扩散模型的专家集成,以支持新型任务如风格插值与模型融合。
  • 发布一个包含多种舞蹈类型、同步音频与3D动作捕捉数据的新型高质量数据集,以供未来研究使用。

提出的方法

  • 将DiffWave扩散模型架构适配至3D人体姿态序列,用Conformer替代空洞卷积,以更好地建模动作数据中的长程时间依赖关系。
  • 采用去噪U-Net主干网络,通过迭代方式优化噪声扰动后的动作序列,条件输入为通过基于Conformer的音频编码器提取的音频嵌入。
  • 在采样过程中应用无分类器指导,通过比较有无类别标签的输出结果,控制风格表达的强度。
  • 提出一种专家集成框架,通过加权几何平均方式组合多个扩散模型的得分函数,实现不同动作风格的插值与融合。
  • 采用多尺度训练目标,鼓励在不同噪声水平下准确重建动作序列,从而提升生成样本质量与训练稳定性。
  • 利用共享音频编码器对所有集成模型进行条件控制,确保不同专家配置下音频到动作的一致性对齐。

实验结果

研究问题

  • RQ1扩散模型能否有效建模音频驱动人体动作的高维性、模糊性与个体化特征,如舞蹈与共言语手势?
  • RQ2与标准卷积架构相比,基于Conformer的架构是否能在扩散模型驱动的动作生成中提升建模性能?
  • RQ3无分类器指导能否有效应用于控制音频驱动动作生成中的风格表达强度?
  • RQ4扩散模型的专家集成能否实现新型能力,如平滑的风格插值与多样化动作风格的融合?
  • RQ5所提方法是否能泛化至路径驱动的行走动作,展示其在手势与舞蹈之外的更广泛应用潜力?

主要发现

  • 所提方法在多个手势与舞蹈数据集上实现了最先进水平的动作质量,无论在定量指标还是定性评估中均优于主流基线模型。
  • 无分类器指导实现了有效且可控的风格表达调节,使用户可根据目标输出特性生成更具或更少表现力的动作。
  • 专家集成框架成功实现了动作风格间的平滑插值,生成的中间动作保持一致且在感知上合理。
  • 该方法在路径驱动的行走任务中表现出良好泛化能力,展现出超越音频条件舞蹈与手势生成的鲁棒性与适应性。
  • 发布了一个包含多种舞蹈类型、高质量3D动作与音频配对的新数据集,为未来研究提供了宝贵的基准。
  • 该框架支持高效推理,并可扩展至多模态生成任务,例如同时基于音频与文本实现语义手势合成。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。