[论文解读] Evaluating language models of tonal harmony
本研究评估了在大规模西方近现代调性音乐语料库中,基于有限上下文(n-gram)和循环神经网络(RNN)的语言模型在和弦预测中的表现,采用一种数据驱动的和弦编码方案以保留和声多样性。基于PPM的有限上下文模型在钢琴音乐中表现优于RNN,因其能够为罕见和弦类型分配概率,这一优势经回归分析证实,RNN在处理概率极低的和弦时表现不佳。
This study borrows and extends probabilistic language models from natural language processing to discover the syntactic properties of tonal harmony. Language models come in many shapes and sizes, but their central purpose is always the same: to predict the next event in a sequence of letters, words, notes, or chords. However, few studies employing such models have evaluated the most state-of-the-art architectures using a large-scale corpus of Western tonal music, instead preferring to use relatively small datasets containing chord annotations from contemporary genres like jazz, pop, and rock. Using symbolic representations of prominent instrumental genres from the common-practice period, this study applies a flexible, data-driven encoding scheme to (1) evaluate Finite Context (or n-gram) models and Recurrent Neural Networks (RNNs) in a chord prediction task; (2) compare predictive accuracy from the best-performing models for chord onsets from each of the selected datasets; and (3) explain differences between the two model architectures in a regression analysis. We find that Finite Context models using the Prediction by Partial Match (PPM) algorithm outperform RNNs, particularly for the piano datasets, with the regression model suggesting that RNNs struggle with particularly rare chord types.
研究动机与目标
- 开发一种数据驱动、灵活的和弦表示方案,以最小化对调性音乐中和弦类型学的先验假设。
- 评估最先进的语言模型——有限上下文(n-gram)和RNN——在大规模近现代时期音乐语料库中的和弦预测表现。
- 比较不同模型架构和数据集之间的预测准确性,尤其关注钢琴音乐与管弦乐音乐之间的性能差异。
- 通过回归分析解释模型性能差异,识别预测误差的关键语料级预测因子。
- 通过支持无监督发现和声结构,弥合数据驱动的和声建模与专家标注的和弦类型学之间的差距。
提出的方法
- 开发了一种灵活、数据驱动的和弦编码方案,基于音高类集合与音阶度数表示和声事件,无需事先假设类型学,即可保留每音阶度数下超过200种不同的和弦类型。
- 研究使用了包含超过100万个和弦标记的复合语料库(1710–1910年),涵盖巴赫经文歌、贝多芬的四重奏与奏鸣曲、肖邦的钢琴作品以及乔普林的拉格泰姆作品,以MusicXML和MIDI格式编码。
- 有限上下文模型通过预测部分匹配(PPM)算法实现,该算法利用上下文历史为未见或罕见和弦类型分配概率。
- 循环神经网络(LSTM)模型在和弦发生序列上端到端训练,以预测序列中的下一个和弦。
- 通过交叉熵损失衡量不同数据集和模型配置下的预测准确性,评估模型性能。
- 采用逐步回归分析,识别影响模型性能差异的语料级特征(如词汇量、标记频率、单音内容)
实验结果
研究问题
- RQ1有限上下文(n-gram)和循环神经网络(RNN)模型在大规模、数据驱动的近现代调性音乐语料库中预测和弦进行的表现如何比较?
- RQ2在有限上下文模型中,PPM算法是否在处理罕见或未见和弦类型时相比RNN具有性能优势?
- RQ3哪些语料级特征(如词汇量、不可能和弦或单音事件的比例)对不同模型架构的预测准确性影响最大?
- RQ4模型性能差异在多大程度上与音乐体裁或乐器配置(如钢琴与管弦乐音乐)相关?
- RQ5数据驱动的和弦表示方案是否能比传统的专家标注类型学,实现更准确且更具泛化能力的调性和声语言建模?
主要发现
- 使用PPM算法的有限上下文模型在和弦预测中优于RNN,尤其在钢琴数据集上,交叉熵得分显著更低。
- PPM能够为未见或罕见和弦类型分配非零概率,是其性能优越的关键因素,回归分析证实RNN在处理概率极低的和弦时表现不佳。
- 对于有限上下文模型,53%的交叉熵方差由四个预测因子解释:标记数量、词汇量、单音内容和不可能事件。
- 相比之下,对于RNN(LSTM),不可能事件的比例对交叉熵有显著正向影响(β = 0.463),表明其在罕见和弦上的泛化能力差。
- RNN模型在较短序列和较小词汇量下表现更好,且受益于相邻重复的标记,但受单音内容和高词汇多样性负面影响。
- 回归结果证实,RNN在建模罕见和声事件方面效率较低,表明其在覆盖调性和声全分布方面存在根本性局限。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。