[论文解读] Fusion of EEG and Musical Features in Continuous Music-emotion Recognition
本研究提出了一种基于唤醒-效价维度的EEG与音乐特征晚期融合方法,用于连续音乐情绪识别。采用滑动窗口的决策级融合策略,结果表明音乐特征在性能上优于EEG单独使用,尤其在受试者无关设置下表现更优,尽管EEG存在个体间差异,但融合通过利用互补信息使性能略有提升。
Emotion estimation in music listening is confronting challenges to capture the emotion variation of listeners. Recent years have witnessed attempts to exploit multimodality fusing information from musical contents and physiological signals captured from listeners to improve the performance of emotion recognition. In this paper, we present a study of fusion of signals of electroencephalogram (EEG), a tool to capture brainwaves at a high-temporal resolution, and musical features at decision level in recognizing the time-varying binary classes of arousal and valence. Our empirical results showed that the fusion could outperform the performance of emotion recognition using only EEG modality that was suffered from inter-subject variability, and this suggested the promise of multimodal fusion in improving the accuracy of music-emotion recognition.
研究动机与目标
- 探究结合EEG与音乐特征是否能提升连续音乐情绪识别性能。
- 评估决策级融合对受试者相关与受试者无关情绪分类的影响。
- 分析各模态的贡献以及滑动窗口大小对分类性能的影响。
- 应对EEG个体间差异及音乐聆听过程中情绪动态变化等挑战。
提出的方法
- 使用10-20导联系统,从12名男性受试者中采集EEG信号,重点关注与情绪调节相关的额叶区域。
- 从MIDI文件中提取音乐特征以表征表达的情绪,排除歌词影响。
- 对EEG信号应用0.5–60 Hz带通滤波,并通过EEGLAB中的独立成分分析(ICA)去除眼动伪影。
- 采用唤醒-效价维度对时变情绪进行建模,使用连续二分类方法。
- 通过系统性调节加权因子(α),在决策层使用加权平均法融合EEG与音乐特征。
- 采用10折分层交叉验证,在不同滑动窗口大小(1–9秒)下评估分类性能。
实验结果
研究问题
- RQ1与单模态方法相比,EEG与音乐特征的决策级融合是否能提升连续音乐情绪识别性能?
- RQ2EEG的个体间差异如何影响情绪分类模型的性能?
- RQ3捕捉音乐聆听过程中时变情绪反应的最优滑动窗口大小是多少?
- RQ4在融合过程中,EEG与音乐特征的贡献如何变化?何种加权比例能实现最佳性能平衡?
- RQ5引入EEG是否能提升受试者无关的情绪识别性能,还是音乐单模态更具鲁棒性?
主要发现
- 在所有受试者无关分类任务中,音乐模态的准确率和MCC均显著高于EEG。
- EEG模态在所有情况下表现最差,尤其在受试者无关设置下,主要受高个体间差异影响。
- 决策级融合在性能上略优于单模态音乐特征,当音乐贡献更大时(α < 0.5)取得最佳结果。
- 受试者相关分类的最优滑动窗口为2秒,受试者无关分类为9秒,但性能在不同窗口大小下保持稳定。
- 随着EEG特征权重(α)增加,其对性能的负面影响加剧,尤其在受试者无关唤醒分类中更为明显。
- 受试者相关结果在高α值时表现出更高方差,表明EEG在部分个体中对唤醒的预测更具信息量。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。