Skip to main content
QUICK REVIEW

[论文解读] Dance Generation with Style Embedding: Learning and Transferring Latent Representations of Dance Styles

Xinjian Zhang, Yi Xu|arXiv (Cornell University)|Apr 30, 2021
Music and Audio Processing参考文献 21被引用 4
一句话总结

该论文提出了一种逐帧的音乐到舞蹈生成框架,通过可控的风格嵌入学习从参考舞蹈片段中提取潜在风格表征,并将其迁移以生成多样且风格一致的舞蹈。通过使用基于Transformer的音乐编码器和风格感知舞蹈生成器,该模型在beat匹配、情感对齐、风格一致性和多样性方面均优于基线模型,其有效性在新构建的大规模音乐到舞蹈数据集上得到验证,该数据集涵盖动漫、popping和locking等风格。

ABSTRACT

Choreography refers to creation of dance steps and motions for dances according to the latent knowledge in human mind, where the created dance motions are in general style-specific and consistent. So far, such latent style-specific knowledge about dance styles cannot be represented explicitly in human language and has not yet been learned in previous works on music-to-dance generation tasks. In this paper, we propose a novel music-to-dance synthesis framework with controllable style embeddings. These embeddings are learned representations of style-consistent kinematic abstraction of reference dance clips, which act as controllable factors to impose style constraints on dance generation in a latent manner. Thus, the dance styles can be transferred to dance motions by merely modifying the style embeddings. To support this study, we build a large music-to-dance dataset. The qualitative and quantitative evaluations demonstrate the advantage of our proposed framework, as well as the ability of synthesizing diverse styles of dances from identical music via style embeddings.

研究动机与目标

  • 为解决音乐到舞蹈生成中缺乏对特定风格知识的显式建模问题,该问题限制了生成舞蹈的多样性和真实感。
  • 通过从参考舞蹈片段中学习潜在风格表征,实现在舞蹈生成中可控的风格迁移。
  • 开发一种框架,仅通过修改风格嵌入即可从同一段音乐生成多样且风格一致的舞蹈。
  • 构建一个大规模、带风格标注的音乐到舞蹈数据集,用于训练和评估风格感知生成模型。
  • 证明在帧级别上音乐与舞蹈的对齐,结合风格嵌入,可同时提升风格保真度和动作多样性。

提出的方法

  • 风格嵌入生成器使用原型方法在共享潜在空间中从参考舞蹈片段学习潜在风格表征。
  • 音乐到舞蹈生成器使用Transformer编码器从音乐输入中提取时序和语义特征。
  • 舞蹈生成器将音乐表征与学习到的风格嵌入相结合,逐帧生成运动序列。
  • 风格嵌入被计算为原型向量的可学习加权组合,从而实现灵活的风格迁移。
  • 该框架采用帧对齐的生成方式,确保音乐节拍与舞蹈动作在时间上同步。
  • 使用逼真的视频渲染模型对生成的舞蹈进行可视化,以支持定性评估。

实验结果

研究问题

  • RQ1能否有效学习并迁移潜在风格表征,从而从同一段音乐生成多样且风格一致的舞蹈?
  • RQ2所提出的框架在beat匹配、情感对齐和风格一致性方面与现有方法相比表现如何?
  • RQ3风格嵌入在不重新训练的情况下,能在多大程度上实现可控的风格迁移?
  • RQ4与使用全局音乐表征相比,使用帧级别的音乐-舞蹈对齐是否能提升生成质量?
  • RQ5当条件输入为不同初始姿态和风格嵌入时,该模型在生成多样化舞蹈动作方面的表现如何?

主要发现

  • 所提框架的beat命中率比Dancing2Music高出1.3%,表明音乐与舞蹈之间的时序对齐性能更优。
  • 该模型展现出强大的情感匹配能力,生成舞蹈的强度曲线与输入音乐的强度轮廓高度吻合。
  • 风格一致性FID分数低于基线模型,表明生成舞蹈与真实舞蹈风格的相似度更高。
  • 多样性得分(通过不同初始姿态下生成舞蹈的风格嵌入间FID计算)显示,该模型显著优于Dancing2Music,展现出更高的多样性。
  • 用户研究表明,该模型在风格一致性方面优于基线模型,参与者更偏好其输出在风格准确性上的表现。
  • 尽管性能优异,但在某些情况下生成的舞蹈仍存在肢体扭曲现象,表明在动作真实感方面仍有改进空间。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。