Skip to main content
QUICK REVIEW

[论文解读] On Perceived Emotion in Expressive Piano Performance: Further Experimental Evidence for the Relevance of Mid-level Perceptual Features

Shreyan Chowdhury, Gerhard Widmer|arXiv (Cornell University)|Jul 28, 2021
Music and Audio Processing参考文献 16被引用 4
一句话总结

本研究探究了中层感知特征在预测六位著名钢琴家演奏巴赫《平均律键盘曲集》第一册时感知情绪(唤醒度与效价)中的作用。通过人类情绪评分及多种特征集——包括低层次音频特征、基于乐谱的特征、预训练情绪特征以及中层感知特征——研究发现,中层特征在捕捉表演特异性情绪变化方面优于其他所有特征,尤其在异常表演中表现突出,凸显其在表达性音乐情绪识别中的关键作用。

ABSTRACT

Despite recent advances in audio content-based music emotion recognition, a question that remains to be explored is whether an algorithm can reliably discern emotional or expressive qualities between different performances of the same piece. In the present work, we analyze several sets of features on their effectiveness in predicting arousal and valence of six different performances (by six famous pianists) of Bach's Well-Tempered Clavier Book 1. These features include low-level acoustic features, score-based features, features extracted using a pre-trained emotion model, and Mid-level perceptual features. We compare their predictive power by evaluating them on several experiments designed to test performance-wise or piece-wise variations of emotion. We find that Mid-level features show significant contribution in performance-wise variation of both arousal and valence -- even better than the pre-trained emotion model. Our findings add to the evidence of Mid-level perceptual features being an important representation of musical attributes for several tasks -- specifically, in this case, for capturing the expressive aspects of music that manifest as perceived emotion of a musical performance.

研究动机与目标

  • 分离不同音乐特征层级在预测表达性钢琴演奏中感知情绪(唤醒度与效价)时的贡献。
  • 评估中层感知特征是否能比低层次音频或基于乐谱的特征更好地捕捉表演特异性情绪特质。
  • 评估预训练情绪模型与中层特征在建模同一首乐曲不同钢琴家诠释之间情绪变化方面的预测能力。
  • 探究中层特征在显著偏离常态情绪表达的个性化表演中是否具有泛化能力。

提出的方法

  • 收集了六位钢琴家完整演奏巴赫《平均律键盘曲集》第一册中48首作品前8小节的人类情绪评分(唤醒度与效价)。
  • 提取了四类特征集:低层次音频特征(如频谱、时间特征)、基于乐谱的特征(如调式、音高高度、攻击速率)、预训练情绪模型特征,以及中层感知特征(如速度、演奏法、动态变化)。
  • 基于这些特征训练线性回归模型以预测唤醒度与效价,分别在表演层面与乐曲层面的变异性实验中进行。
  • 利用唤醒度-效价空间中的椭圆轮廓法识别异常表演,以检验模型在个性化诠释中的泛化能力。
  • 通过逻辑回归对每类特征集使用四象限标签(快乐、放松、悲伤、愤怒)进行离散情绪分类评估。
  • 采用留一法交叉验证进行情绪分类,并报告回归任务的R²分数以比较模型性能。

实验结果

研究问题

  • RQ1中层感知特征能否在同首乐曲的不同演奏中可靠地预测感知情绪(唤醒度与效价)?
  • RQ2在建模表演特异性情绪变化方面,中层感知特征相较于低层次音频特征、基于乐谱的特征以及预训练情绪模型特征,其预测能力如何?
  • RQ3中层特征在显著偏离常态情绪表达的异常表演中,其泛化能力在多大程度上成立?
  • RQ4中层特征在与音乐推荐系统相关的离散情绪分类任务中是否具有优势?

主要发现

  • 中层感知特征在预测唤醒度与效价的表演层面变异方面显著优于所有其他特征集,其R²分数高于预训练情绪模型。
  • 基于椭圆轮廓法的异常检测识别出48个表演为情绪上独特的个体(包括格伦·古尔德13段、弗里德里希·古尔达10段等),中层特征在该测试集上表现出最强的预测性能。
  • 基于乐谱的特征在效价预测中表现出乎意料地好,主要归因于调式特征与效价的强相关性,尤其因效价变异通常小于唤醒度变异。
  • 在离散情绪分类中,所有特征集表现相近,但中层特征略占优势,其准确率显著高于0.25的随机基线。
  • 中层特征表现出稳健性与可解释性,使其成为可解释情绪识别的理想选择,适用于情绪感知音乐推荐与生成音乐等应用。
  • 结果证实,中层感知特征不仅有效,而且对捕捉音乐演奏中表达性、表演者依赖的情绪特质至关重要。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。