[论文解读] A Novel Multi-Task Learning Method for Symbolic Music Emotion Recognition
该论文提出MT-SMNN,一种用于符号音乐情感识别(SMER)的新型多任务学习框架,通过联合训练情感识别与关键和力度分类作为辅助任务。通过利用音乐内在结构——调性与力度值——而无需额外的人工标注,该方法在EMOPIA和VGMIDI数据集上分别实现了4.17%和1.97%的准确率提升,达到当前最先进性能。
Symbolic Music Emotion Recognition(SMER) is to predict music emotion from symbolic data, such as MIDI and MusicXML. Previous work mainly focused on learning better representation via (mask) language model pre-training but ignored the intrinsic structure of the music, which is extremely important to the emotional expression of music. In this paper, we present a simple multi-task framework for SMER, which incorporates the emotion recognition task with other emotion-related auxiliary tasks derived from the intrinsic structure of the music. The results show that our multi-task framework can be adapted to different models. Moreover, the labels of auxiliary tasks are easy to be obtained, which means our multi-task methods do not require manually annotated labels other than emotion. Conducting on two publicly available datasets (EMOPIA and VGMIDI), the experiments show that our methods perform better in SMER task. Specifically, accuracy has been increased by 4.17 absolute point to 67.58 in EMOPIA dataset, and 1.97 absolute point to 55.85 in VGMIDI dataset. Ablation studies also show the effectiveness of multi-task methods designed in this paper.
研究动机与目标
- 解决现有SMER方法忽视对情感表达至关重要的音乐结构特征的局限性。
- 通过整合源自音乐内在结构的辅助任务(如调性和力度)来提升符号音乐情感识别性能。
- 开发一种仅需情感标签进行训练的多任务框架,其中辅助标签可从符号音乐数据中自动提取。
- 在公开SMER基准数据集(EMOPIA和VGMIDI)上以极少的额外参数实现最先进性能。
- 建立一种可推广的框架,适用于多种预训练模型的符号音乐表征。
提出的方法
- 提出一种多任务学习框架MT-SMNN,联合优化情感识别与两个辅助任务:调性分类和力度分类。
- 使用Krumhansl-Kessler算法从符号音乐数据中自动确定调性,从而消除对手动标注的需求。
- 直接从MIDI文件中提取力度值,作为响度的代理,利用力度与感知响度之间的已知相关性。
- 通过在共享表征上添加任务特定分类器,将辅助任务集成到现有预训练模型(如MIDIBERT-Piano、MIDIGPT)中。
- 使用结合情感、调性和力度分类的交叉熵损失函数,端到端训练模型。
- 在训练过程中应用早停和模型检查点机制,以防止过拟合并确保最优性能。
实验结果
研究问题
- RQ1将调性和力度等音乐结构特征纳入模型是否能提升符号音乐情感识别性能?
- RQ2源自音乐内在结构的辅助任务如何影响SMER模型的泛化能力和鲁棒性?
- RQ3所提出的多任务框架是否在标准SMER基准上优于预训练模型的单任务微调?
- RQ4性能提升是源于多任务学习机制本身,还是仅仅因为参数量增加?
- RQ5在辅助任务中,调性分类与力度分类哪一个对情感识别性能的贡献更为显著?
主要发现
- MT-SMNN框架在EMOPIA数据集上实现了67.58%的新最先进准确率,相比之前最先进方法绝对提升4.17%。
- 在VGMIDI数据集上,该方法达到55.85%的准确率,相比先前最先进方法绝对提升1.97%。
- 消融实验表明,调性分类和力度分类任务均能提升情感识别性能,其中调性分类贡献更大(提升3.6%),力度分类贡献较小(提升1.3%)。
- 混淆矩阵分析显示,该框架特别提升了高唤醒度类别(Q1:快乐,Q4:平静)的分类性能,表明对积极情绪的敏感性增强。
- 性能提升归因于多任务学习机制,而非模型容量增加,因为额外分类器引入的参数极少。
- 该框架具有良好的可推广性,可无需修改架构地应用于多种预训练模型(如MIDIBERT-Piano、MIDIGPT)。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。