[论文解读] AccoMontage: Accompaniment Arrangement via Phrase Selection and Style Transfer
AccoMontage 通过结合动态规划的短语检索与神经风格迁移,提出了一种混合方法来实现钢琴伴奏编配,将所选参考材料与原谱风格对齐。该方法在完整民谣/流行歌曲的连贯性、结构和音乐性方面达到了最先进水平,显著优于基于学习和基于模板的基线模型。
Accompaniment arrangement is a difficult music generation task involving intertwined constraints of melody, harmony, texture, and music structure. Existing models are not yet able to capture all these constraints effectively, especially for long-term music generation. To address this problem, we propose AccoMontage, an accompaniment arrangement system for whole pieces of music through unifying phrase selection and neural style transfer. We focus on generating piano accompaniments for folk/pop songs based on a lead sheet (i.e., melody with chord progression). Specifically, AccoMontage first retrieves phrase montages from a database while recombining them structurally using dynamic programming. Second, chords of the retrieved phrases are manipulated to match the lead sheet via style transfer. Lastly, the system offers controls over the generation process. In contrast to pure learning-based approaches, AccoMontage introduces a novel hybrid pathway, in which rule-based optimization and deep learning are both leveraged to complement each other for high-quality generation. Experiments show that our model generates well-structured accompaniment with delicate texture, significantly outperforming the baselines.
研究动机与目标
- 解决现有深度学习模型在生成完整歌曲长期、结构连贯的伴奏方面的局限性。
- 通过利用现有音乐参考而非从零开始生成,提升旋律-伴奏的和声和谐度与织体一致性。
- 通过用户定义的织体特征(如节奏密度和声部数量)实现可控的音乐生成。
- 将基于规则的短语检索与基于深度学习的风格迁移统一,以提升生成质量。
- 将伴奏编配建模为受人类作曲实践启发的混合优化与生成流水线。
提出的方法
- 将短语选择建模为图优化问题,其中节点代表候选短语,边代表状态转移,节点得分基于基于规则的适应度,边得分通过对比学习进行学习。
- 使用动态规划将所选短语重新组合为符合原谱结构约束的连贯序列。
- 通过神经风格迁移对和弦进行调整,使检索到的短语和声内容与查询原谱的和弦进行式相匹配。
- 系统采用和弦-织体解耦技术,实现在再和声过程中对和声与织体特征的独立控制。
- 应用对比损失,通过最小化节奏密度和声部数量的差异,确保相邻短语之间过渡平滑。
- 用户可预先通过两个可控的织体特征(节奏密度和声部数量)筛选候选短语,实现用户导向的生成。
实验结果
研究问题
- RQ1结合基于模板的检索与神经风格迁移的混合方法,是否能生成比纯学习方法更连贯、结构更一致的伴奏?
- RQ2通过动态规划进行短语检索,在完整歌曲中能否有效保持长期音乐结构?
- RQ3风格迁移在多大程度上提升了参考短语与给定原谱之间和声与织体的匹配度?
- RQ4用户可控的特征(如节奏密度和声部数量)是否能增强生成伴奏的可控性与质量?
- RQ5所提出方法在客观指标和主观人类评估中是否均优于现有基线?
主要发现
- 在主观评估中,AccoMontage 在连贯性(p < 0.05)和结构(p < 0.05)方面显著优于两种基线模型,72名受试者在5分制量表上对生成的伴奏进行评分。
- 模型在连贯性上获得平均4.3分,结构上获得平均4.2分,表明与旋律具有强和声和谐度与结构对齐。
- 对比损失在从随机到同首歌再到相邻短语对时呈现出一致的下降趋势,证明了对平滑过渡的可靠检测能力。
- 短语准确率(Rank@50)为0.2425,歌曲准确率(Rank@50)为0.3769,表明从候选池中选择正确相邻短语的性能较强。
- 在音乐性方面表现略优(p = 0.053),尽管未达到严格统计显著性,但仍表明整体音乐质量较高。
- 结果证实,将基于规则的短语检索与基于深度学习的风格迁移相结合,可实现高质量、可控且长期的完整歌曲伴奏生成。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。