QUICK REVIEW
[论文解读] Towards Movement Generation with Audio Features
Benedikte Wallace, Charles Martín|arXiv (Cornell University)|Nov 26, 2020
Music and Audio Processing参考文献 14被引用 4
一句话总结
本文提出了一种生成式混合密度循环神经网络(MDRNN),该网络能够基于高阶音频特征(如脉冲清晰度和子带频谱通量)生成逼真的舞蹈动作。实验结果表明,该模型生成的动作序列能根据音频输入产生有意义的变化,展示了声音与动作之间学习到的跨模态依赖关系。
ABSTRACT
Sound and movement are closely coupled, particularly in dance. Certain audio features have been found to affect the way we move to music. Is this relationship between sound and movement something which can be modelled using machine learning? This work presents initial experiments wherein high-level audio features calculated from a set of music pieces are included in a movement generation model trained on motion capture recordings of improvised dance. Our results indicate that the model learns to generate realistic dance movements which vary depending on the audio features.
研究动机与目标
- 探究机器学习是否能够建模音频特征与人类舞蹈动作之间的关系。
- 开发一种生成模型,能够基于音频特征生成逼真且多样的舞蹈动作。
- 研究特定音频特征(脉冲清晰度和子带频谱通量)如何影响动作生成。
- 评估模型在未见音频输入下的泛化能力,同时保持动作的真实性。
提出的方法
- 在54段时长为一分钟的即兴舞蹈动作捕捉数据上训练混合密度循环神经网络(MDRNN),采样频率为30Hz,22个人体关节点在三维空间中表示。
- 通过5秒滑动窗口(步长0.08秒)提取音频特征——脉冲清晰度和子带频谱通量(50–100 Hz和3200–6400 Hz频段),并与动作帧对齐。
- 模型执行序列到序列的映射:给定当前动作姿态和音频特征,预测下一帧姿态,且输出中不包含音频信息。
- 数据通过最小-最大归一化、样条插值以及二阶巴特沃斯滤波进行预处理,以减少抖动,并确保对尺度和位置的不变性。
- 采用引导技术评估音频影响:在参考动作序列的条件下,改变音频输入以测试模型对音频变化的敏感性。
- 使用Adam优化器进行训练,基于验证损失采用早停策略;采用Keras-MDN层实现概率密度估计。
实验结果
研究问题
- RQ1深度生成模型是否能够学习根据音频特征生成逼真且多样的舞蹈动作?
- RQ2该模型在训练中未见过的音乐音频特征上,其泛化能力如何?
- RQ3特定音频特征(脉冲清晰度和子带频谱通量)如何影响生成动作的风格与稳定性?
- RQ4模型是否依赖结构化的音频输入,以在帧级别生成平滑、逼真的动作?
主要发现
- 即使在无音频输入的情况下,MDRNN仍能生成逼真的舞蹈动作,表明其对动作动态具有强大的建模能力。
- 当使用训练集中音频特征进行条件控制时,模型生成的动作序列与引导示例高度一致,但表现力有所降低。
- 当使用训练数据中未出现的新歌曲的音频特征时,模型仍能生成合理的动作,但抖动增加,表明存在部分泛化能力。
- 当音频特征被白噪声替代时,生成的动作显著变得抖动,表明模型依赖结构化音频输入以生成平滑动作。
- 模型展现出学习到的跨模态依赖关系:不同音频特征导致不同的动作模式,证实音频特征塑造了动作生成过程。
- 在所有音频条件下,模型均能保持合理的姿态预测,表明其在音频变化下仍具备稳健的动作预测能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。