[论文解读] A Classifying Variational Autoencoder with Application to Polyphonic Music Generation
本文提出了一种分类变分自编码器(CVAE),通过引入分类器在训练过程中推断离散的音乐调性类别,实现对特定调性中多声部音乐的可控生成。通过将CVAE与LSTM结合,该模型在未转调的原始调性数据上训练时,其生成的音乐在调性一致性方面显著优于标准VAE,尤其在保持原始调性方面表现更优。
The variational autoencoder (VAE) is a popular probabilistic generative model. However, one shortcoming of VAEs is that the latent variables cannot be discrete, which makes it difficult to generate data from different modes of a distribution. Here, we propose an extension of the VAE framework that incorporates a classifier to infer the discrete class of the modeled data. To model sequential data, we can combine our Classifying VAE with a recurrent neural network such as an LSTM. We apply this model to algorithmic music generation, where our model learns to generate musical sequences in different keys. Most previous work in this area avoids modeling key by transposing data into only one or two keys, as opposed to the 10+ different keys in the original music. We show that our Classifying VAE and Classifying VAE+LSTM models outperform the corresponding non-classifying models in generating musical samples that stay in key. This benefit is especially apparent when trained on untransposed music data in the original keys.
研究动机与目标
- 解决标准VAE在生成特定调式或类别(如音乐调性)数据方面的局限性。
- 实现可控音乐生成,使模型能够在不依赖数据转调的情况下,按用户指定的调性进行生成。
- 使模型能够在推理过程中根据序列历史推断调性,支持与音乐家的实时即兴演奏。
- 在原始调性数据上训练时,相比标准VAE和VAE+LSTM模型,提升生成音乐的调性一致性。
- 证明将调性建模为离散类别可提升序列音乐生成中的重构质量与音乐连贯性。
提出的方法
- 该模型通过引入一个分类器网络扩展了标准VAE,用于预测每个输入序列的离散类别(如音乐调性)。
- 类别概率采用Logistic正态分布建模,从而可使用重参数化技巧进行端到端训练,结合随机梯度变分贝叶斯方法。
- 在训练过程中,通过重参数化梯度对潜在类别变量进行采样,使反向传播能够通过分类器输出。
- 将识别网络与生成网络与LSTM结合,以建模多声部音乐中的序列依赖关系。
- 分类器与VAE的识别和生成网络联合训练,使模型能够从输入序列上下文推断调性。
- 模型在未转调的音乐数据上进行训练,保留原始调性,可生成受指定调性条件控制的样本,或从上下文推断调性。
实验结果
研究问题
- RQ1能否扩展VAE以显式建模并从离散类别(如音乐调性)生成数据,而无需数据转调?
- RQ2在VAE框架中引入分类器是否能提升生成多声部音乐序列的调性一致性?
- RQ3模型是否能在推理过程中根据序列历史推断调性,从而支持与音乐家的实时即兴演奏?
- RQ4当在原始调性数据上训练时,Classifying VAE+LSTM在保持调性方面相较于标准VAE+LSTM的性能如何?
- RQ5该模型能否生成高质量、连贯的音乐样本,且在较长序列中保持调性一致性?
主要发现
- 在未转调的音乐数据上训练时,Classifying VAE+LSTM模型生成样本的调性一致性与原始种子序列的调性一致性相当。
- 在原始调性数据集上,Classifying VAE+LSTM在调性一致性方面优于标准VAE+LSTM模型,后者生成的样本调性极不一致。
- 当提供种子序列的真实调性时,Classifying VAE+LSTM在所有数据集上均优于其他所有模型,展现出更优的调性一致性。
- 所有模型的每时间步平均音符数和音程跨度均与JSB Chorales测试数据相差不超过6%,表明音乐结构合理。
- 该模型成功学习到一个可解释的潜在空间,当保持潜在码不变而改变类别标签(调性)时,可生成不同的调性输出。
- 使用Logistic正态分布对类别概率建模,使模型可通过重参数化技巧实现高效训练,而无需采用高斯混合模型或边际化离散类别方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。