Skip to main content
QUICK REVIEW

[论文解读] Linguistic and Gender Variation in Speech Emotion Recognition using Spectral Features

Zachary Dair, Ryan Donovan|arXiv (Cornell University)|Dec 17, 2021
Music and Audio Processing被引用 4
一句话总结

本研究探讨了性别与语言差异对语音情感识别(SER)的影响,采用梅尔频率倒谱系数(MFCC)、梅尔频谱图和频谱对比度等频谱特征。在英语、德语和意大利语数据集上训练了卷积神经网络(CNN),结果显示:在单语和跨语言设置中,情感分类准确率较高,但在多语言数据中显著降低,且男性与女性说话者之间表现差异明显,尤其在高能量(如愤怒、喜悦)和低能量(如厌恶、恐惧)情感上。

ABSTRACT

This work explores the effect of gender and linguistic-based vocal variations on the accuracy of emotive expression classification. Emotive expressions are considered from the perspective of spectral features in speech (Mel-frequency Cepstral Coefficient, Melspectrogram, Spectral Contrast). Emotions are considered from the perspective of Basic Emotion Theory. A convolutional neural network is utilised to classify emotive expressions in emotive audio datasets in English, German, and Italian. Vocal variations for spectral features assessed by (i) a comparative analysis identifying suitable spectral features, (ii) the classification performance for mono, multi and cross-lingual emotive data and (iii) an empirical evaluation of a machine learning model to assess the effects of gender and linguistic variation on classification accuracy. The results showed that spectral features provide a potential avenue for increasing emotive expression classification. Additionally, the accuracy of emotive expression classification was high within mono and cross-lingual emotive data, but poor in multi-lingual data. Similarly, there were differences in classification accuracy between gender populations. These results demonstrate the importance of accounting for population differences to enable accurate speech emotion recognition.

研究动机与目标

  • 探讨使用频谱特征时性别与语言差异对语音情感识别(SER)的影响。
  • 评估基于CNN的模型在单语、多语和跨语言语音情感分类中的性能。
  • 识别在不同人群(性别与语言)中对情感分类最有效的频谱特征(MFCC、梅尔频谱图、频谱对比度)。
  • 评估与性别和语言相关的语音差异对SER系统泛化能力和准确率的影响。
  • 强调需要标准化的数据采集与归一化技术,以提升跨语言与跨性别SER的性能。

提出的方法

  • 从英语、德语和意大利语的音频数据中提取了包括梅尔频率倒谱系数(MFCC)、梅尔频谱图和频谱对比度在内的频谱特征。
  • 使用提取的频谱特征训练并评估了卷积神经网络(CNN)在情感分类中的表现。
  • 在三种设置下测试了该模型:单语(训练与测试语言相同)、多语言(训练与测试包含多种语言)和跨语言(在一种语言上训练,在另一种语言上测试)。
  • 通过对比分析,确定了在不同性别与语言群体中对情感分类最有效的频谱特征。
  • 通过实证评估,使用性能指标分析了性别与语言对分类准确率的影响,涵盖六种基本情绪(愤怒、厌恶、恐惧、喜悦、悲伤、惊讶)。
  • 进行了统计评估,以确定性能差异是源于固有群体差异还是数据采样限制。

实验结果

研究问题

  • RQ1语音特征中的性别差异如何影响使用频谱特征进行语音情感识别的准确率?
  • RQ2英语、德语和意大利语之间的语言差异在多大程度上影响基于CNN的情感分类模型性能?
  • RQ3在不同性别与语言群体中,哪些频谱特征(MFCC、梅尔频谱图、频谱对比度)对情感分类最有效?
  • RQ4为何多语言SER性能相比单语和跨语言设置显著下降?录音差异与归一化在其中起到什么作用?
  • RQ5信号能量与振幅特性如何影响不同语言中男性与女性说话者的情感检测准确率?

主要发现

  • CNN模型在单语和跨语言设置中实现了较高的情感分类准确率,但在多语言设置中性能显著下降,主要由于语言差异与录音变异。
  • 高能量情感(如愤怒与喜悦)在德语男性说话者中被更准确地检测到,可能由于该群体具有更高的振幅和更粗糙的语音特征。
  • 低能量情感(如厌恶与恐惧)在所有语言中女性说话者的语音中分类更准确,可能由于振幅较低且发音更柔和。
  • 男性与女性说话者之间频谱表征的显著差异导致了性别特异性性能差异,混合性别模型的表现低于性别特异性模型。
  • 本研究发现,与振幅和能量相关的频谱特征对准确的情感识别至关重要,尤其是在考虑性别与语言差异时。
  • 样本量较小(N = 40)以及语言组间说话者分布不均可能夸大了观察到的差异,限制了结果的泛化能力,提示未来研究需采用更大且更均衡的数据集。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。