Skip to main content
QUICK REVIEW

[论文解读] Focal Loss based Residual Convolutional Neural Network for Speech Emotion Recognition

Suraj Tripathi, Abhay Kumar|arXiv (Cornell University)|Jun 11, 2019
Speech and Audio Processing参考文献 23被引用 14
一句话总结

该论文提出了一种基于焦点损失优化的残差卷积神经网络(ResNet)用于语音情感识别,利用频谱图和梅尔频率倒谱系数(MFCCs)作为输入特征,以提升对难以分类的情感实例的分类性能。该方法通过聚焦于难分类样本的训练,减轻了易分类样本的主导影响,在IEMOCAP数据集上实现了最先进性能。

ABSTRACT

This paper proposes a Residual Convolutional Neural Network (ResNet) based on speech features and trained under Focal Loss to recognize emotion in speech. Speech features such as Spectrogram and Mel-frequency Cepstral Coefficients (MFCCs) have shown the ability to characterize emotion better than just plain text. Further Focal Loss, first used in One-Stage Object Detectors, has shown the ability to focus the training process more towards hard-examples and down-weight the loss assigned to well-classified examples, thus preventing the model from being overwhelmed by easily classifiable examples.

研究动机与目标

  • 为解决语音情感识别中的类别不平衡问题,即易于分类的情感类别在训练中占主导地位。
  • 通过聚焦于难以分类的情感实例来提升模型的泛化能力。
  • 将原本用于目标检测的焦点损失整合到深度残差CNN架构中,用于语音情感识别。
  • 评估在语音情感识别中,使用频谱图和MFCC特征结合焦点损失对分类准确率的提升效果。
  • 在语音情感识别的IEMOCAP基准数据集上实现最先进性能。

提出的方法

  • 该模型采用残差卷积神经网络(ResNet)架构,从语音频谱图和MFCCs中提取分层的空间与时间特征。
  • 在训练中应用焦点损失,该损失函数降低已正确分类样本的贡献,并在反向传播中强调难分类样本。
  • 焦点损失函数定义为:$ FL(p_t) = -α(1-p_t)^\u03b3 \log(p_t) $,其中 $ p_t $ 是模型对真实类别预测的概率,$ \alpha $ 为平衡因子,$ \gamma $ 控制聚焦机制。
  • 输入特征为预处理后的频谱图和MFCCs,这些特征已知能捕捉语音中与感知相关的情感线索。
  • 使用随机梯度下降结合焦点损失端到端训练网络,以优化对细微或模糊情感状态的判别能力。
  • 该架构采用残差块以缓解梯度消失问题,支持更深网络的训练。

实验结果

研究问题

  • RQ1焦点损失是否能通过聚焦于难分类样本,提升深度CNN在语音情感识别中的性能?
  • RQ2将焦点损失与ResNet架构结合,对类别不平衡的语音情感识别数据集的分类准确率有何影响?
  • RQ3结合焦点损失时,使用频谱图和MFCCs作为输入特征是否能提升模型性能?
  • RQ4与标准交叉熵损失相比,该方法在IEMOCAP数据集上的F1分数和准确率表现如何?
  • RQ5焦点损失在多大程度上减少了模型对易于分类情感类别的偏见?

主要发现

  • 所提出的基于焦点损失的ResNet在IEMOCAP数据集上的F1分数显著优于标准交叉熵训练方法。
  • 该模型在识别细微或模糊情感类别方面表现更优,这些类别在标准训练中常被误分类。
  • 焦点损失减少了模型对易于分类样本的关注,从而在不同情感类别间实现了更均衡的学习。
  • 将频谱图与MFCC特征结合焦点损失,其准确率高于单独使用任一特征类型。
  • 该方法在IEMOCAP基准数据集上实现了最先进性能,优于先前使用标准交叉熵损失的方法。
  • 消融实验确认,焦点损失机制显著提升了模型对难分类样本的泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。