QUICK REVIEW
[论文解读] Talking Drums: Generating drum grooves with neural networks
Patrick Hutchings|arXiv (Cornell University)|Jun 29, 2017
Music and Audio Processing参考文献 6被引用 5
一句话总结
本文提出一种受神经机器翻译启发的序列到序列RNN模型,通过风格条件化标记化方案,从Kick鼓输入生成完整的爵士鼓组节奏。在每个节拍细分中采样概率最高的三个鼓击音符,取得了最佳性能,在用户调查中获得39%的‘良好’评分,性能高度依赖于音乐风格。
ABSTRACT
Presented is a method of generating a full drum kit part for a provided kick-drum sequence. A sequence to sequence neural network model used in natural language translation was adopted to encode multiple musical styles and an online survey was developed to test different techniques for sampling the output of the softmax function. The strongest results were found using a sampling technique that drew from the three most probable outputs at each subdivision of the drum pattern but the consistency of output was found to be heavily dependent on style.
研究动机与目标
- 开发一种实时打击乐代理,能够生成匹配多种音乐风格的完整爵士鼓组演奏。
- 将原本用于机器翻译的序列到序列神经网络适配于生成音乐上连贯的鼓点模式。
- 评估并优化模型Softmax输出的采样策略,以提升感知到的音乐质量。
- 通过将输出质量与概率分布关联,实现在多智能体音乐创作系统中的自我评分。
- 探索将鼓节奏建模为具有共享语义意图的结构化多乐器‘语言’的可行性。
提出的方法
- 从流行、摇滚、放克和非洲-古巴风格中解析250首爵士鼓乐谱(每种风格约7,000至7,500小节),转换为music-XML格式,并按每4/4小节48个细分进行标记化。
- 为每种鼓类型分配唯一字母标记(如K代表Kick,S代表Snare),并使用风格描述符作为特殊标记,以实现在单一网络中对多种风格的建模。
- 采用具有128个单元的层和3层堆叠的RNN序列到序列架构,使用学习率为0.55的梯度下降法进行训练。
- 将编码器输入反转,并使用独热编码处理Kick鼓模式作为输入序列。
- 实现三种采样技术:贪婪解码、全概率轮盘采样和前3个概率的轮盘采样。
- 开发了一个基于网络的界面,允许用户输入Kick鼓模式,并实时通过采样鼓音色评估生成的节奏。
实验结果
研究问题
- RQ1在鼓谱数据上训练的序列到序列神经网络,能否从Kick鼓输入生成音乐上连贯的完整爵士鼓组节奏?
- RQ2针对模型Softmax输出的哪种采样策略,能为人类听者带来最令人愉悦的鼓节奏?
- RQ3不同音乐风格(尤其是非洲-古巴和放克风格)下,生成节奏的感知质量如何变化?
- RQ4模型内部的概率分布能否用于实现在多智能体音乐创作系统中的自我评分?
- RQ5风格约束(如非洲-古巴音乐中的Clave模式)在模型的训练和生成过程中在多大程度上自然浮现?
主要发现
- 前3个概率采样方法(方法3)在在线调查中获得了最高的‘良好’评分比例(39%),优于贪婪解码和全概率轮盘采样。
- 贪婪解码器(方法1)产生的结果最一致但最不受青睐,70%的评分被归类为‘一般’。
- 对所有概率进行轮盘采样的方法2(方法2)‘差’评分比例最高(28%),表明过度随机化降低了音乐连贯性。
- 平均评分在鼓音符初始概率介于0.7至0.8之间的峰值达到1.54,表明感知质量存在一个信心度的‘最佳区间’。
- 非洲-古巴风格的节奏获得显著更高的‘差’评分(24%),高于其他风格(16–18%),表明在捕捉典型节奏结构方面可能存在局限。
- 模型的输出质量高度依赖于音乐风格,流行、摇滚和放克风格的节奏一致性更高,听者评分也更优,而非洲-古巴风格的节奏表现较差。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。