Skip to main content
QUICK REVIEW

[论文解读] Emotion Recognition from Speech

Kannan Venkataramanan, Haresh Rengaraj Rajamohan|arXiv (Cornell University)|Dec 22, 2019
Emotion and Mood Recognition参考文献 19被引用 9
一句话总结

本文提出一种四层二维卷积神经网络(4-layer 2D CNN),结合对数梅尔倒谱系数特征(log-mel spectrogram features)用于基于语音的情绪识别,在 RAVDESS 数据集上实现了 14 类任务(2 种性别 × 7 种情绪)的 68% 准确率。研究发现,特征选择(尤其是对数梅尔倒谱系数)比模型复杂度更为关键,且由于音高和能量的差异,性别特定建模可提升性能。

ABSTRACT

In this work, we conduct an extensive comparison of various approaches to speech based emotion recognition systems. The analyses were carried out on audio recordings from Ryerson Audio-Visual Database of Emotional Speech and Song (RAVDESS). After pre-processing the raw audio files, features such as Log-Mel Spectrogram, Mel-Frequency Cepstral Coefficients (MFCCs), pitch and energy were considered. The significance of these features for emotion classification was compared by applying methods such as Long Short Term Memory (LSTM), Convolutional Neural Networks (CNNs), Hidden Markov Models (HMMs) and Deep Neural Networks (DNNs). On the 14-class (2 genders x 7 emotions) classification task, an accuracy of 68% was achieved with a 4-layer 2 dimensional CNN using the Log-Mel Spectrogram features. We also observe that, in emotion recognition, the choice of audio features impacts the results much more than the model complexity.

研究动机与目标

  • 识别语音情绪识别(SER)中最有效的音频特征与深度学习架构。
  • 评估不同特征类型(MFCC、对数梅尔倒谱系数、音高、能量)与架构(LSTM、CNN、HMM、DNN)下的模型性能。
  • 通过在外部 TESS 数据集上测试,评估模型的泛化能力。
  • 探究性别特定建模是否因音高与能量差异而提升 SER 性能。
  • 通过激活图可视化与注意力机制探索模型的可解释性。

提出的方法

  • 本研究使用 RAVDESS 数据集,其中包含 1440 个语音语句,涵盖 24 名演员的 8 种情绪,性别与强度分布均衡。
  • 对音频进行预处理,并转换为对数梅尔倒谱系数、MFCC、音高与能量特征,作为模型输入。
  • 采用四层二维卷积神经网络(2D CNN)结合全局平均池化作为主要架构,在对数梅尔倒谱系数上进行训练,用于 14 类与二分类(正向/负向情绪)情绪分类任务。
  • 通过验证集与测试集上的准确率、F1 分数、Top-2 与 Top-3 分类准确率评估模型性能。
  • 对 TESS 数据集进行微调与测试,以评估模型的鲁棒性与泛化能力。
  • 使用类激活图(Class activation maps)可视化对数梅尔倒谱系数中对最终预测影响最大的区域,提升模型可解释性。

实验结果

研究问题

  • RQ1哪种音频特征表示(如对数梅尔倒谱系数、MFCC、音高、能量)在语音情绪识别中准确率最高?
  • RQ2模型架构(如 2D CNN、LSTM、HMM、3D CNN)在 RAVDESS 数据集上的性能表现如何?
  • RQ3由于音高与能量的差异,性别特定情绪分类是否能提升模型准确率?
  • RQ4在 RAVDESS 上训练的模型在 TESS 数据集上的泛化能力如何,是否表明对领域偏移具有鲁棒性?
  • RQ5注意力机制或空洞空间金字塔池化(Atrous Spatial Pyramid Pooling, ASPP)能否进一步提升 SER 中的特征学习能力?

主要发现

  • 四层 2D CNN 搭配对数梅尔倒谱系数特征在 14 类情绪识别任务中实现了 68% 的测试准确率,优于其他模型与特征组合。
  • 对数梅尔倒谱系数显著优于 MFCC,即使在结合差分系数后依然表现更优,表明其在情绪线索上具有更强的判别能力。
  • 性别特定情绪分类因男性与女性声音在音高与能量上的固有差异而提升了性能。
  • 在二分类任务(正向 vs. 负向情绪)中,模型准确率达到 88%,表明在更广泛的情绪类别上表现强劲。
  • 在外部 TESS 数据集上,模型实现了 62% 的准确率,远超 14% 的随机猜测水平,表明其在训练数据之外具有稳健的泛化能力。
  • 模型因一名 64 岁女性说话人音高过低而错误判断其性别,提示需要基于说话人年龄与性别的分层模型。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。