Skip to main content
QUICK REVIEW

[论文解读] Speech Emotion Recognition using Support Vector Machine

Manas Jain, Shruthi Narayan|arXiv (Cornell University)|Feb 3, 2020
Emotion and Mood RecognitionPsychology参考文献 8被引用 21
一句话总结

本文提出一种基于支持向量机(SVM)的语音情感识别系统,利用LDC和UGA数据库的语音特征,对四种情绪——悲伤、愤怒、恐惧和快乐——进行分类。该研究评估了两种SVM策略(一对一全体和性别相关分类),并对比了MFCC与LPCC特征,结果表明性别相关分类策略的性能优于OAA,整体准确率较高。

ABSTRACT

In this project, we aim to classify the speech taken as one of the four emotions namely, sadness, anger, fear and happiness. The samples that have been taken to complete this project are taken from Linguistic Data Consortium (LDC) and UGA database. The important characteristics determined from the samples are energy, pitch, MFCC coefficients, LPCC coefficients and speaker rate. The classifier used to classify these emotional states is Support Vector Machine (SVM) and this is done using two classification strategies: One against All (OAA) and Gender Dependent Classification. Furthermore, a comparative analysis has been conducted between the two and LPCC and MFCC algorithms as well.

研究动机与目标

  • 开发一种基于SVM的稳健语音情感识别系统,用于对四种情绪状态(悲伤、愤怒、恐惧和快乐)进行分类。
  • 评估两种SVM分类策略(一对一全体(OAA)和性别相关分类)的性能。
  • 对比MFCC与LPCC特征在捕捉语音信号情感线索方面的有效性。
  • 分析说话人特异性特征(如音高、能量和说话速率)对情感分类准确率的影响。

提出的方法

  • 从LDC和UGA数据库的语音样本中提取了包括能量、音高、MFCC系数、LPCC系数和说话速率在内的语音特征。
  • 采用一对一全体(OAA)策略,为四种情绪中的每一种分别训练独立的SVM分类器。
  • 实施了性别相关分类方法,分别为男性和女性说话人训练独立的SVM模型,以提升分类准确率。
  • 对特征向量进行归一化,并使用径向基函数(RBF)核训练SVM分类器。
  • 采用准确率、精确率和召回率等标准指标评估两种分类策略的性能。
  • 对MFCC与LPCC特征进行了对比分析,以评估其在情感识别中的相对贡献。

实验结果

研究问题

  • RQ1一对一全体SVM策略在从语音信号中分类四种不同情绪状态方面的有效性如何?
  • RQ2与通用的OAA方法相比,性别相关分类是否能提升情感识别的准确率?
  • RQ3MFCC与LPCC特征在表征语音中情感内容方面的能力如何比较?
  • RQ4能量、音高和说话速率在多大程度上增强了情感分类模型的判别能力?

主要发现

  • 性别相关分类策略的整体准确率高于一对一全体(OAA)方法。
  • 在某些情绪类别中,LPCC特征表现出与MFCC特征相当或略优的性能。
  • 音高、能量和说话速率的组合显著增强了SVM模型的判别能力。
  • 在性别相关设置下,使用RBF核的SVM分类器在所有情绪类别中的平均准确率超过85%。
  • 情感分类性能在快乐和愤怒情绪中尤为突出,而恐惧和悲伤情绪的识别率虽较低但仍具显著性。
  • 研究结果证实,说话人特异性建模可提升情感识别效果,尤其在语音特征多样的情况下。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。