Skip to main content
QUICK REVIEW

[论文解读] FineDance: A Fine-grained Choreography Dataset for 3D Full Body Dance Generation

Ronghui Li, Junfan Zhao|arXiv (Cornell University)|Dec 7, 2022
Human Pose and Action Recognition被引用 5
一句话总结

FineDance 引入了一个大规模的 14.6 小时 3D 音乐-舞蹈配对数据集,包含细粒度的手部动作和 22 种舞蹈类型,实现了高保真度、类型匹配的全身舞蹈生成。所提出的 FineNet 框架采用基于扩散模型的全身生成网络,配备针对身体和手部动作的专家头,并通过 Refine Net 进行优化,同时引入一种关注类型与一致性的检索模块,以确保长期连贯性和类型匹配,实现了在类型匹配和动作质量方面的最先进性能。

ABSTRACT

Generating full-body and multi-genre dance sequences from given music is a challenging task, due to the limitations of existing datasets and the inherent complexity of the fine-grained hand motion and dance genres. To address these problems, we propose FineDance, which contains 14.6 hours of music-dance paired data, with fine-grained hand motions, fine-grained genres (22 dance genres), and accurate posture. To the best of our knowledge, FineDance is the largest music-dance paired dataset with the most dance genres. Additionally, to address monotonous and unnatural hand movements existing in previous methods, we propose a full-body dance generation network, which utilizes the diverse generation capabilities of the diffusion model to solve monotonous problems, and use expert nets to solve unreal problems. To further enhance the genre-matching and long-term stability of generated dances, we propose a Genre&Coherent aware Retrieval Module. Besides, we propose a novel metric named Genre Matching Score to evaluate the genre-matching degree between dance and music. Quantitative and qualitative experiments demonstrate the quality of FineDance, and the state-of-the-art performance of FineNet. The FineDance Dataset and more qualitative samples can be found at our website.

研究动机与目标

  • 为解决缺乏大规模、高保真度的 3D 音乐-舞蹈数据集,特别是缺乏细粒度手部动作和多样化舞蹈类型的问题。
  • 克服现有 AI 舞蹈生成方法中单调且不自然的手部动作。
  • 提升生成舞蹈与输入音乐之间在长期序列上的连贯性与类型匹配度。
  • 开发一种新型度量标准,以客观评估音乐驱动舞蹈生成中的类型匹配度。
  • 实现从任意音乐中合成多样化、富有表现力且类型一致的 3D 舞蹈序列。

提出的方法

  • 提出 FineDance,一个包含 346 对音乐-舞蹈的 14.6 小时 3D 动作捕捉数据集,涵盖 22 种细粒度舞蹈类型,并提供精确的全身姿态(包括手部动作)。
  • 提出 FineNet,一种两阶段生成合成框架:首先,采用基于扩散模型的全身舞蹈生成网络(FDGN),并为身体和手部动作分别设计专家网络。
  • 使用 Refine Net 协调并优化身体与手部专家的联合输出,确保空间与时间上的一致性。
  • 整合一种关注类型与一致性的检索模块(GCRM),从数据库中检索类型匹配且时间连贯的舞蹈片段,用于长期序列生成。
  • 采用一种新型的类型匹配度评分(GS)度量标准,对音乐与生成舞蹈类型之间的对齐程度进行定量评估。
  • 结合扩散建模与基于检索的合成方法,以提升生成舞蹈的多样性、真实感和长期稳定性。

实验结果

研究问题

  • RQ1一个大规模、细粒度的 3D 舞蹈数据集,包含精确的手部动作和多样化的舞蹈类型,是否能提升音乐驱动舞蹈生成的质量与多样性?
  • RQ2基于扩散模型的生成方法,配合专用于身体和手部动作的专家网络,能否有效减少不自然或单调的手部动作?
  • RQ3基于检索的模块在多大程度上能增强生成舞蹈序列的类型匹配度与长期连贯性?
  • RQ4所提出的类型匹配度评分(GS)度量标准是否能有效且客观地量化音乐与舞蹈之间的类型对齐程度?
  • RQ5混合生成-合成框架是否能在定量指标和定性用户感知方面均优于纯生成或纯检索基线方法?

主要发现

  • FineDance 是目前最大的 3D 音乐-舞蹈配对数据集,包含 14.6 小时数据、22 种细粒度舞蹈类型以及精确的手部动作标注。
  • FineNet 实现了 0.77 的类型匹配度评分(GS),显著优于基线方法如 DanceRevolution(0.37)和 DeepDance(0.32),证明其在类型匹配方面的优越性。
  • 用户研究表明,FineNet 的平均艺术性得分为 77.0,优于所有基线方法,接近真实数据(96.0),尤其在类型匹配与整体艺术性方面表现突出。
  • FineNet 平均有效舞蹈时长达到 28.2 秒,显著优于仅生成方法(如 DanceRevolution:5.4 秒),表明其长期稳定性显著提升。
  • 消融实验证实,FDGN 搭配专家网络与 Refine Net 的组合实现了最低的 FID(1.66)与最高的 MM(16.72),证明了该架构的有效性。
  • 与 FDGN-C 相比,GCRM 模块使 GS 提升 0.28,MM 提升 5.21,证明其在增强类型匹配度与动作多样性方面的重要作用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。