[论文解读] Computer Assisted Composition with Recurrent Neural Networks
本文提出一种混合系统,结合基于LSTM的循环神经网络与通过有限状态机实现的人机协同约束,以实现计算机辅助音乐创作。该研究引入一种高效的顺序蒙特卡洛(SMC)方法,用于从非马尔可夫序列模型中近似采样,并与束搜索(beam search)在条件概率最大化方面进行比较,结果表明在宽松约束条件下,采样方法能生成更具音乐多样性和自然感的结果。
Sequence modeling with neural networks has lead to powerful models of symbolic music data. We address the problem of exploiting these models to reach creative musical goals, by combining with human input. To this end we generalise previous work, which sampled Markovian sequence models under the constraint that the sequence belong to the language of a given finite state machine provided by the human. We consider more expressive non-Markov models, thereby requiring approximate sampling which we provide in the form of an efficient sequential Monte Carlo method. In addition we provide and compare with a beam search strategy for conditional probability maximisation. Our algorithms are capable of convincingly re-harmonising famous musical works. To demonstrate this we provide visualisations, quantitative experiments, a human listening test and audio examples. We find both the sampling and optimisation procedures to be effective, yet complementary in character. For the case of highly permissive constraint sets, we find that sampling is to be preferred due to the overly regular nature of the optimisation based results. The generality of our algorithms permits countless other creative applications.
研究动机与目标
- 开发一种系统,支持人机作曲家在音乐创作中的协作,利用先进的神经序列模型。
- 通过引入随机采样,解决基于优化方法生成输出过于规整的局限性。
- 将先前在马尔可夫模型与有限状态机约束方面的研究推广至非马尔可夫、富有表现力的序列模型(如LSTM)。
- 评估在生成音乐连贯且多样的再 harmonization(和声重配)任务中,采样与优化方法的效能。
- 通过音频示例、可视化结果与人工听音测试,展示该方法的可行性与创意潜力。
提出的方法
- 采用长短期记忆(LSTM)循环神经网络,建模在给定节拍与时值条件下的音乐序列条件分布。
- 将人类输入表示为有限状态机(FSM),定义允许的音乐序列语言。
- 使用带系统重采样的顺序蒙特卡洛(SMC)方法,执行近似推理并从FSM约束下的条件分布中采样。
- 将束搜索作为替代方法,以在相同约束下最大化序列的条件概率。
- 应用因果因子分解,建模在给定节拍与时值下音符序列的条件概率,实现高效计算。
- 整合采样与优化策略,实现灵活、交互式的音乐创作。
实验结果
研究问题
- RQ1非马尔可夫序列模型(如LSTM)能否与人类提供的约束有效结合,用于创意音乐创作?
- RQ2在宽松约束条件下,基于采样的方法与基于优化的方法在音乐多样性与连贯性方面如何比较?
- RQ3顺序蒙特卡洛方法是否能有效实现受有限状态机约束的富有表现力的非马尔可夫模型的近似推理?
- RQ4该系统能否在保持节奏结构与音乐意图的前提下,成功对古典作品进行令人信服的再和声处理?
- RQ5人类听觉感知上,基于采样与束搜索生成的结果在音乐质量方面有何差异?
主要发现
- 顺序蒙特卡洛(SMC)采样方法在宽松约束条件下,生成的再和声处理结果比束搜索更具音乐多样性与自然感。
- 束搜索结果被发现过于规整且重复,尤其在约束宽松时,因模型倾向于高概率但冗余的模式所致。
- 当至少有一条声部被固定为约束条件时,采样与优化方法均表现良好,表明即使最小程度的人类输入也能有效引导高质量创作。
- 粒子滤波器(SMC)在和声解决质量方面仅略逊于无约束情况,但避免了无约束运行中出现的最差解决情况。
- 人工听音测试确认,SMC生成的音乐在感知上被认为比束搜索输出更具音乐趣味性与多样性。
- 该系统成功对莫扎特的弦乐四重奏进行了再和声处理,通过固定旋律线,生成了和声连贯、风格恰当的伴奏。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。