[论文解读] Controllable deep melody generation via hierarchical music structure representation
本文提出 MusicFrameworks,一种分层音乐结构表征方法,通过将音乐分解为段落/乐句结构、基础旋律、节奏与和弦约束,实现可控的长篇旋律生成。该方法采用基于 Transformer 的独立网络分别生成节奏与旋律,再通过基于这些组件的自回归优化,使生成旋律在 50% 的听觉测试中达到人类水平的音乐性,展现出通过结构化、模块化生成实现的强可控性与样本效率。
Recent advances in deep learning have expanded possibilities to generate music, but generating a customizable full piece of music with consistent long-term structure remains a challenge. This paper introduces MusicFrameworks, a hierarchical music structure representation and a multi-step generative process to create a full-length melody guided by long-term repetitive structure, chord, melodic contour, and rhythm constraints. We first organize the full melody with section and phrase-level structure. To generate melody in each phrase, we generate rhythm and basic melody using two separate transformer-based networks, and then generate the melody conditioned on the basic melody, rhythm and chords in an auto-regressive manner. By factoring music generation into sub-problems, our approach allows simpler models and requires less data. To customize or add variety, one can alter chords, basic melody, and rhythm structure in the music frameworks, letting our networks generate the melody accordingly. Additionally, we introduce new features to encode musical positional information, rhythm patterns, and melodic contours based on musical domain knowledge. A listening test reveals that melodies generated by our method are rated as good as or better than human-composed music in the POP909 dataset about half the time.
研究动机与目标
- 解决现有深度学习音乐生成模型在长期结构化旋律生成中难以保持重复性与形式一致性的关键挑战。
- 通过支持用户对段落、乐句、旋律轮廓与节奏模式等高层结构的操控,提升音乐生成的可控性。
- 通过将音乐生成分解为子问题(节奏、基础旋律、完整旋律)并采用模块化、分层表征,降低数据需求与模型复杂度。
- 将音乐归纳偏置(如位置编码、轮廓建模、节奏模式)整合至深度学习模型中,以提升样本效率与音乐性。
- 通过客观指标与大规模主观听觉测试,将该方法与人类创作音乐进行对比,以评估音乐质量与可用性。
提出的方法
- 提出 MusicFrameworks:一种分层音乐结构表征,可从全局段落、乐句级结构到局部节奏与旋律形式对歌曲进行多层级建模。
- 将旋律生成分解为三个阶段:(1) 使用基于 Transformer 的网络生成基础节奏;(2) 使用另一组基于 Transformer 的网络生成基础旋律;(3) 通过自回归方式生成完整旋律,条件依赖于和弦、基础旋律与节奏。
- 设计特定领域的特征编码,用于表示音乐位置、旋律轮廓与节奏模式,以将音乐归纳偏置注入神经网络。
- 采用两阶段训练流程:首先独立训练基础节奏与旋律网络,随后使用真实结构输入对完整旋律网络进行微调。
- 通过允许用户在任意层级(如更改和弦进行、调整轮廓、修改节奏形式)编辑音乐框架,实现可控性,模型将据此生成新旋律。
- 应用分析算法从现有人类创作歌曲中提取音乐框架,实现风格模仿与数据高效训练。
实验结果
研究问题
- RQ1分层音乐结构表征是否能提升深度生成旋律的一致性与长期连贯性?
- RQ2用户对音乐框架的可控修改(如和弦变化、轮廓调整、节奏修改)在多大程度上能生成有意义且音乐上合理的旋律变体?
- RQ3与端到端生成相比,采用模块化、结构感知的生成方式是否能在保持或提升音乐质量的同时减少数据需求?
- RQ4在主观听觉测试中,MusicFrameworks 生成的旋律与人类创作音乐相比,音乐质量如何?
- RQ5音乐特定的归纳偏置(如轮廓、节奏模式)在有限训练数据下对提升模型性能起到何种作用?
主要发现
- 在听觉测试中,使用 MusicFrameworks 生成的旋律在约 50% 的对比中被评为与人类创作音乐相当或更优,表明其具备强大的音乐性与可用性。
- 与跳过基础旋律与节奏生成步骤的基线模型相比,该方法显著更优,偏好测试显示使用这些框架的生成结果评分更高。
- 基于生成的基础旋律与节奏条件生成的旋律,其评分与基于人类创作对应物的生成结果相似,表明模型学习到了真实且音乐上连贯的表征。
- 尽管在部分对比中(如 0 vs 1)人类创作音乐仍具统计学显著偏好,但整体表现表明 MusicFrameworks 可生成高质量、与人类竞争的成果。
- 听者指出,采样失真与重复音偶发地降低了音乐感知质量,但此类问题相对较少,未主导整体评价。
- 该方法表明,通过分层表征可实现长期结构一致性,重复乐句共享相同框架,并生成音乐上连贯的变体。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。