Skip to main content
QUICK REVIEW

[论文解读] Dance2Music: Automatic Dance-driven Music Generation

Gunjan Aggarwal, Devi Parikh|arXiv (Cornell University)|Jul 13, 2021
Human Motion and Animation参考文献 15被引用 8
一句话总结

本文提出Dance2Music系统,通过离线搜索方法或在线深度学习模型,从舞蹈视频生成音乐。与强基线相比,人类偏好度显著提升,离线与在线方法的偏好度分别达到77%和70%,证明了通过姿态-音符相关性优化,实现了舞蹈动作与音乐音符的有效同步。

ABSTRACT

Dance and music typically go hand in hand. The complexities in dance, music, and their synchronisation make them fascinating to study from a computational creativity perspective. While several works have looked at generating dance for a given music, automatically generating music for a given dance remains under-explored. This capability could have several creative expression and entertainment applications. We present some early explorations in this direction. We present a search-based offline approach that generates music after processing the entire dance video and an online approach that uses a deep neural network to generate music on-the-fly as the video proceeds. We compare these approaches to a strong heuristic baseline via human studies and present our findings. We have integrated our online approach in a live demo! A video of the demo can be found here: https://sites.google.com/view/dance2music/live-demo.

研究动机与目标

  • 探索以舞蹈为条件的自动音乐生成,该方向相较于音乐到舞蹈生成仍研究不足。
  • 开发一种能与舞蹈情感和节奏流动感觉同步的音乐生成系统。
  • 通过人类评估,比较从舞蹈视频生成音乐的离线与在线方法。
  • 创建一个实时演示,展示从实时舞蹈输入生成音乐。
  • 在人类研究中建立一个强有力的启发式基线以供比较。

提出的方法

  • 使用OpenPose从舞蹈视频中提取18个关键点的2D姿态,每帧归一化为36维向量。
  • 将音乐表示为C大调五声音阶(C4, D4, E4, G4, A4)的音符,以确保协和性并便于感知。
  • 采用基于搜索的离线方法,在局部时间窗口内最大化姿态相似性与音符相似性之间的皮尔逊相关系数。
  • 实现一个在线深度神经网络,模仿离线方法的相关性优化,实现实时音乐生成。
  • 使用束搜索(beam size B),结合局部与全局姿态相似性历史,指导音符序列的选择。
  • 在455个AIST数据集视频上训练在线模型,并在45个视频上进行评估,达到73.5%的准确率和0.33的平均相关系数(与离线方法相比)。

实验结果

研究问题

  • RQ1基于搜索的离线方法能否生成比强启发式基线更被感知为与舞蹈同步的音乐?
  • RQ2通过模仿离线方法训练的深度学习模型,能否实现实时、即时的音乐生成,并与人类对同步性的感知相匹配?
  • RQ3使用局部姿态历史与全局姿态历史相比,对音乐输出的动态性与感知质量有何影响?
  • RQ4在线神经网络与离线搜索方法在音符预测准确率和与舞蹈动作相关性方面,性能差距如何?
  • RQ5与基线音乐相比,由舞蹈动作生成的音乐在人类评估中是否表现出统计学上显著的偏好?

主要发现

  • 在人类研究中,离线方法相较于基线的胜率高达77%,表明人们显著偏好将姿态相似性与音符相似性相关联的音乐。
  • 在线深度学习方法在人类研究中获得70%的胜率,同样具有统计学显著性,证明了其在实时生成中的强大性能。
  • 在线模型在预测下一个音符方面的测试准确率为73.5%,显著高于20%的随机基线。
  • 在线模型生成的音符序列与舞蹈姿态序列之间的皮尔逊相关系数平均为0.33,离线方法为0.38,表明与优化目标有良好对齐。
  • 在离线方法中,使用局部历史生成的音乐比使用全局历史更具动态性,后者导致音符序列显得呆板。
  • 在线方法的实时演示成功展示了从实时视频输入生成音乐,验证了该系统在实际部署中的可行性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。