[论文解读] Bach or Mock? A Grading Function for Chorales in the Style of J.S. Bach
本文提出了一种可学习、可解释的评分函数,通过10种音乐特征(包括音高、节奏、音程、和声、平行音程、重复序列等)评估四声部经文歌在J.S.巴赫风格下的风格真实性。该函数利用生成经文歌与真实巴赫经文歌在特征分布间的Wasserstein距离,并按误差比率加权,实现92.6%的准确率,可区分巴赫作品与生成作品,优于人类专家的86.7%。
Deep generative systems that learn probabilistic models from a corpus of existing music do not explicitly encode knowledge of a musical style, compared to traditional rule-based systems. Thus, it can be difficult to determine whether deep models generate stylistically correct output without expert evaluation, but this is expensive and time-consuming. Therefore, there is a need for automatic, interpretable, and musically-motivated evaluation measures of generated music. In this paper, we introduce a grading function that evaluates four-part chorales in the style of J.S. Bach along important musical features. We use the grading function to evaluate the output of a Transformer model, and show that the function is both interpretable and outperforms human experts at discriminating Bach chorales from model-generated ones.
研究动机与目标
- 为使用深度学习模型生成巴赫风格音乐的评估,解决缺乏自动、可解释且基于音乐学的度量标准的问题。
- 通过开发一致、可扩展的基准,减少对昂贵且不一致的人工评估的依赖,以评估音乐生成模型。
- 通过逐特征评分识别生成经文歌中的具体音乐缺陷,从而实现对模型的针对性改进。
- 评估自动化评分函数是否能在区分真实巴赫经文歌与模型生成作品方面超越人类专家。
提出的方法
- 评分函数通过生成经文歌与其特征分布与真实巴赫经文歌之间Wasserstein距离的加权和,为经文歌计算一个实数值评分。
- 特征包括音高分布(音阶度数)、节奏(以四分音符为单位的音符时值)、声部特定的音程分布(旋律音程)、和声性质(大调/小调/属七和弦)、平行音程错误(纯五度、八度)以及重复序列长度。
- 平行错误特征采用基于误差数与巴赫平均值相比的误差率的动态权重,对错误数量显著偏高的经文歌施加惩罚。
- 该函数使用music21实现,并在351首真实巴赫经文歌的语料库上进行训练,以定义真实分布基准。
- 总评分为加权和:$ g(c) = \sum_{f\in\text{features}} w_f \cdot \text{Wass}(P_c^f, P_{\text{Bach}}^f) $,其中数值越低表示风格契合度越高。
- 通过配对判别测试评估模型性能,将人类判断与评分函数的预测结果进行比较。
实验结果
研究问题
- RQ1是否可以开发一种完全自动、可解释的评分函数,可靠评估AI生成的四声部经文歌在J.S.巴赫风格下的风格真实性?
- RQ2各个音乐特征(如音程、平行音程、节奏)如何影响总评分?它们揭示了生成音乐中的哪些缺陷?
- RQ3评分函数是否在区分真实巴赫经文歌与模型生成作品方面优于人类专家?
- RQ4评分函数在多大程度上可作为一致、可扩展的基准,用于比较不同音乐生成模型?
- RQ5生成经文歌在音乐特征分布上与真实巴赫经文歌相比,在音高、和声与节奏结构等关键维度上存在何种差异?
主要发现
- 评分函数在配对判别任务中达到92.6%的准确率,优于人类专家的86.7%。
- Kolmogorov–Smirnov检验确认了巴赫经文歌与生成经文歌评分分布之间存在高度显著差异,p值为1e-78。
- 所有特征中,生成经文歌的表现均显著劣于巴赫经文歌,其中偏差最大的是平行错误(中位数2.16 vs. 0.0)和重复序列(中位数1.86 vs. 1.29)。
- 评分函数成功识别出具体作曲缺陷,例如六处平行八度与同度音程,以及高音声部中异常长的四分音符E重复序列。
- 模型在避免平行五度与八度方面表现最差,表现为平行错误距离中位数为2.16,而巴赫经文歌为0.0。
- 通过突出显示特征特定的距离,评分函数的可解释性得到验证,使研究人员能够诊断模型局限性并指导模型优化。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。