[论文解读] Supervised Symbolic Music Style Translation Using Synthetic Data
本文提出首个完全监督的符号音乐风格迁移神经模型,利用合成数据克服真实世界对齐数据集匮乏的问题。通过生成无限量的配对数据(同一首音乐在多种风格下),该方法训练一个以目标风格嵌入为条件的编码器-解码器架构,在真实MIDI输入上实现高质量、音乐上连贯的风格迁移,即使在未见过的风格之间亦可实现。
Research on style transfer and domain translation has clearly demonstrated the ability of deep learning-based algorithms to manipulate images in terms of artistic style. More recently, several attempts have been made to extend such approaches to music (both symbolic and audio) in order to enable transforming musical style in a similar manner. In this study, we focus on symbolic music with the goal of altering the 'style' of a piece while keeping its original 'content'. As opposed to the current methods, which are inherently restricted to be unsupervised due to the lack of 'aligned' data (i.e. the same musical piece played in multiple styles), we develop the first fully supervised algorithm for this task. At the core of our approach lies a synthetic data generation scheme which allows us to produce virtually unlimited amounts of aligned data, and hence avoid the above issue. In view of this data generation scheme, we propose an encoder-decoder model for translating symbolic music accompaniments between a number of different styles. Our experiments show that our models, although trained entirely on synthetic data, are capable of producing musically meaningful accompaniments even for real (non-synthetic) MIDI recordings.
研究动机与目标
- 为解决符号音乐风格迁移中缺乏对齐数据集的问题,该问题迄今限制了方法仅能采用无监督学习。
- 开发一种监督方法,能够学习细粒度风格迁移,超越粗粒度流派标签的限制。
- 实现对音乐伴奏(低音与钢琴)的端到端风格迁移,转换为多样化的目标风格,同时保持和声内容不变。
- 评估仅在合成数据上训练的模型在真实、未见MIDI录音上的泛化能力。
- 提出一种新颖的客观度量指标,用于评估音乐风格相似性,以衡量翻译质量。
提出的方法
- 一个合成数据生成管道通过将特定风格的变换应用于单一源乐谱,生成多个风格下的配对音乐片段。
- 训练一个编码器-解码器神经架构,将输入音乐(内容)映射到目标风格,条件基于学习到的风格嵌入向量。
- 该模型使用共享编码器表示内容,并通过条件解码器基于风格嵌入生成低音与钢琴双音轨。
- 风格嵌入通过训练过程中的对比目标进行学习,从而实现解耦且有意义的风格表征。
- 提出一种基于和声与节奏特征的新客观度量指标,用于评估生成风格与目标风格之间的风格相似性。
- 该方法借鉴神经机器翻译技术,将其适配于带有风格条件的符号音乐任务。
实验结果
研究问题
- RQ1当缺乏真实对齐数据时,完全监督的符号音乐风格迁移方法是否依然有效?
- RQ2合成数据生成能否产生足够真实且多样的训练配对数据,以实现对真实世界MIDI输入的泛化?
- RQ3通过将单个解码器条件化于学习到的风格嵌入,是否能够实现在大量不同音乐风格上的高质量迁移?
- RQ4与仅在单一风格对上训练相比,多风格训练在真实、未见数据上的泛化能力如何?
- RQ5学习到的风格嵌入空间是否能捕捉到有意义且解耦的音乐风格特征?
主要发现
- 仅在合成数据上训练的模型能很好地泛化到真实MIDI录音,生成音乐连贯且风格准确的低音与钢琴伴奏。
- 在70种风格上训练的70→70模型在真实世界数据上的泛化能力显著优于仅在单一风格对上训练的1→1模型,表明多风格训练具有优势。
- 风格嵌入空间展现出有意义的几何结构,LDA可视化显示‘平稳’与‘摇摆’节奏感风格之间存在清晰分离。
- 模型能有效保持和声结构,内容保留度量指标证实即使在生成复杂节奏模式时也保持稳定。
- 尽管偶尔出现节奏误差——尤其在切分节奏中——但生成的音轨在组合后仍保持连贯且风格一致。
- 客观风格相似性度量与感知质量高度相关,验证了其在评估翻译保真度方面的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。