[论文解读] MeloForm: Generating Melody with Musical Form based on Expert Systems and Neural Networks
MeloForm 是一种混合系统,通过将专家系统用于结构作曲与基于 Transformer 的神经网络用于旋律优化相结合,实现对旋律音乐形式的精确控制。它在音乐形式控制方面达到 97.79% 的准确率,在主观评估中于结构、主题性、丰富度和整体质量方面均优于基线模型 0.75–0.89 分,且无需使用标注的音乐形式数据。
Human usually composes music by organizing elements according to the musical form to express music ideas. However, for neural network-based music generation, it is difficult to do so due to the lack of labelled data on musical form. In this paper, we develop MeloForm, a system that generates melody with musical form using expert systems and neural networks. Specifically, 1) we design an expert system to generate a melody by developing musical elements from motifs to phrases then to sections with repetitions and variations according to pre-given musical form; 2) considering the generated melody is lack of musical richness, we design a Transformer based refinement model to improve the melody without changing its musical form. MeloForm enjoys the advantages of precise musical form control by expert systems and musical richness learning via neural models. Both subjective and objective experimental evaluations demonstrate that MeloForm generates melodies with precise musical form control with 97.79% accuracy, and outperforms baseline systems in terms of subjective evaluation score by 0.75, 0.50, 0.86 and 0.89 in structure, thematic, richness and overall quality, without any labelled musical form data. Besides, MeloForm can support various kinds of forms, such as verse and chorus form, rondo form, variational form, sonata form, etc.
研究动机与目标
- 为解决在数据驱动的音乐生成中生成具有明确高层音乐形式(如主歌-副歌、奏鸣曲式)旋律的挑战。
- 克服纯神经网络模型的局限性,后者隐式学习重复但缺乏精确的形式控制。
- 将专家系统用于精确的结构作曲,与神经网络结合以增强旋律的表现力。
- 通过专家规则生成合成的、完全标注正确的形式数据,消除对昂贵人工标注音乐形式数据的依赖。
- 实现在多种音乐形式(如回旋曲式、变奏曲式、奏鸣曲式)下灵活、与形式无关的旋律生成。
提出的方法
- 专家系统通过分层发展动机形成乐句与段落,依据预设的音乐形式应用重复与变体,生成旋律。
- 基于 Transformer 的优化模型通过条件化于细粒度的节奏与和声模式,在保持原始音乐形式的同时提升旋律的丰富度。
- 优化策略在乐句层面运行,通过使用段落区分标记(如 'AVGPITCH', 'SPAN')进行迭代优化,以调节紧张感与表现力。
- 音乐形式数据由专家系统合成生成,为训练与评估提供零成本、完全准确的标签。
- 通过调整结构构建与变体规则,系统支持多种音乐形式——例如,奏鸣曲式中的再现部使用转位,变奏曲式中使用动机发展。
- 神经优化模型通过调音、节奏与段落级特征进行条件化,以确保形式一致且音乐上连贯的输出。
实验结果
研究问题
- RQ1混合专家系统与神经网络的方法是否能在无需标注数据的情况下,实现旋律生成中精确的高层音乐形式控制?
- RQ2基于规则的结构作曲与神经优化相结合,在提升旋律丰富度与表现力方面效果如何?
- RQ3在主观与客观的音乐质量评估中,该方法相较于纯数据驱动模型的优越程度如何?
- RQ4该系统能否在多种音乐形式(如主歌-副歌、回旋曲式、变奏曲式、奏鸣曲式)中实现泛化?
- RQ5优化流程中的哪些组件(如节奏条件化、迭代优化、段落区分)对感知质量贡献最大?
主要发现
- MeloForm 在音乐形式控制方面达到 97.79% 的准确率,证明其在无需任何标注数据的情况下,能够实现精确且可靠的结构生成。
- 在主观评估中,MeloForm 在结构、主题性、丰富度和整体质量方面分别优于基线模型 0.75、0.50、0.86 和 0.89 分。
- 消融研究证实,专家系统与神经优化组件均不可或缺,任一组件移除均导致性能显著下降。
- 细粒度节奏条件化与段落区分标记的引入显著提升了感知质量,偏好性评估结果已证实这一点。
- 该系统成功在多种音乐形式(包括主歌-副歌、回旋曲式、变奏曲式与奏鸣曲式)中实现泛化,且保持一致的结构与表现质量。
- 作者发布了合成的旋律数据集与代码,为未来音乐形式建模与结构化生成研究提供支持。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。