[论文解读] Transformer-XL Based Music Generation with Multiple Sequences of Time-valued Notes
该论文提出了一种基于Transformer-XL的音乐生成框架,采用四种时间值化的音符序列——on-to-on持续时间、on-to-off持续时间、音高和力度——而非绝对时间来更自然地建模音乐。通过在这些序列上联合训练四个独立的Transformer-XL网络,该模型能够生成稳定、长达一小时的音乐,显著提升了节奏一致性、动态控制和和声结构,在自动评估与人工评估中均优于Music Transformer、DeepJ和单序列Transformer-XL。
Current state-of-the-art AI based classical music creation algorithms such as Music Transformer are trained by employing single sequence of notes with time-shifts. The major drawback of absolute time interval expression is the difficulty of similarity computing of notes that share the same note value yet different tempos, in one or among MIDI files. In addition, the usage of single sequence restricts the model to separately and effectively learn music information such as harmony and rhythm. In this paper, we propose a framework with two novel methods to respectively track these two shortages, one is the construction of time-valued note sequences that liberate note values from tempos and the other is the separated usage of four sequences, namely, former note on to current note on, note on to note off, pitch, and velocity, for jointly training of four Transformer-XL networks. Through training on a 23-hour piano MIDI dataset, our framework generates significantly better and hour-level longer music than three state-of-the-art baselines, namely Music Transformer, DeepJ, and single sequence-based Transformer-XL, evaluated automatically and manually.
研究动机与目标
- 为解决绝对时间在音乐生成中的局限性,该局限会阻碍节拍无关的相似性计算以及对相对音符时长的准确建模。
- 克服单序列建模的限制,通过将时间、音高和力度信息解耦为四个独立序列,实现联合学习。
- 实现稳定、长时音乐生成(最长可达36小时),具备一致的音符密度、正确的节奏模式和富有表现力的动态控制。
- 通过建模作曲家乐谱中的相对时间(而非演奏者录音中的绝对时间),提升音乐质量。
提出的方法
- 提出一种四元组时间值化音符表示法:(on2on, on2off, pitch, velocity),其中on2on与on2off编码与节拍无关的相对时长。
- 将音乐序列分解为四个独立序列——on2on、on2off、pitch与velocity,每个序列由一个独立的Transformer-XL网络处理。
- 在四个序列间共享词嵌入,并在联合训练中结合其交叉熵损失,以实现多流表征学习。
- 应用Transformer-XL中的相对位置编码与分段级递归机制,以建模长序列音乐中的长距离依赖关系。
- 在23小时的钢琴MIDI数据集上训练该框架,使用pretty_midi等标准MIDI处理工具进行特征提取。
- 采用固定初始序列的提示机制,以评估长时音乐生成的稳定性与连贯性。
实验结果
研究问题
- RQ1使用相对时间值化音符序列(on2on、on2off)而非绝对时间建模音乐,是否能提升模型生成音乐连贯且节拍无关音乐的能力?
- RQ2将时间、音高与力度信息解耦为四个独立序列,是否能增强模型学习并生成复杂音乐结构(如和弦进行与动态轮廓)的能力?
- RQ3多序列、多Transformer-XL框架能否在长达一小时的生成中保持稳定,且不出现音符密度或节奏一致性显著下降的问题?
- RQ4在客观指标与人工评估方面,该框架与Music Transformer、DeepJ及单序列Transformer-XL等最先进模型相比表现如何?
主要发现
- 该模型成功生成了连续36小时的音乐样本,音符密度稳定,展现出前所未有的长时音乐生成能力。
- 在长序列中音符密度保持一致,而Music Transformer与单序列Transformer-XL因NOTE_ON/OFF匹配错误导致密度显著下降。
- 生成音乐的音高分布最接近原始数据集,表明其成功学习了音符音级与音域的分布模式。
- 模型学习到了常见的和弦进行,如主和弦到属和弦(如C大调到D大调),显示出和声结构学习的证据。
- 力度模式平滑且富有表现力,具有渐变变化与段落间的情绪对比,接近真实音乐的乐句处理。
- 人工评估确认,该模型的输出在长时生成中更稳定、更富音乐连贯性,相比基线模型更少出现不自然或紊乱的音符模式。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。