Skip to main content
QUICK REVIEW

[论文解读] Emotion Classification from Noisy Speech - A Deep Learning Approach

Rajib Rana|arXiv (Cornell University)|Jan 1, 2016
Emotion and Mood Recognition参考文献 20被引用 6
一句话总结

本文提出一种基于深度置信网络(DBN)的语音情感分类方法,适用于噪声环境,利用堆叠的受限玻尔兹曼机(RBMs)从梅尔频率倒谱系数(MFCCs)中学习鲁棒的分层特征。该方法表现出较强的抗噪能力,在低方差噪声条件下分类准确率下降不足10%,甚至在'洗衣机'噪声条件下准确率略有提升,表明DBN对中等程度噪声污染具有内在的鲁棒性。

ABSTRACT

This paper investigates the performance of Deep Learning for speech emotion classification when the speech is compounded with noise. It reports on the classification accuracy and concludes with the future directions for achieving greater robustness for emotion recognition from noisy speech.

研究动机与目标

  • 为解决真实世界噪声环境中语音情感识别的挑战,此前的研究多集中于干净语音。
  • 评估深度置信网络(DBNs)在语音信号受不同类型环境噪声污染时进行情感分类的鲁棒性。
  • 研究不同噪声类型对分类性能的影响,并识别DBN在何种条件下能保持或提升准确率。
  • 制定DBN最优配置与特征选择策略,以提升在噪声语音环境下的性能。

提出的方法

  • 本研究采用三层RBMs组成的深度置信网络(DBN)架构,各隐藏层分别包含1000、1000和2000个神经元,使用对比散度进行贪婪逐层预训练。
  • 语音特征从分段语音中提取为13维梅尔频率倒谱系数(MFCCs),作为DBN的输入。
  • 通过从DEMAND数据库引入18种人工噪声(包括汽车、厨房和咖啡厅噪声)到柏林数据库的干净情感语音片段中,模拟真实世界条件。
  • 在语音段级别进行情感分类,利用DBN的最后一层输出,通过Softmax实现七种情感的多分类预测。
  • 通过测量所有噪声类型下干净语音与噪声语音之间分类准确率的百分比变化来评估性能。
  • 在预训练后,使用反向传播对DBN进行微调,以优化最终分类层。

实验结果

研究问题

  • RQ1环境噪声的存在如何影响基于DBN的语音情感分类性能?
  • RQ2哪些类型的噪声导致情感分类准确率下降最多和最少?
  • RQ3在某些噪声类型存在时,DBN能否保持甚至提升分类准确率?若能,原因是什么?
  • RQ4噪声的变异性与幅值对DBN模型在情感识别中的鲁棒性有何影响?
  • RQ5如何通过优化DBN架构与特征选择来提升在噪声语音场景下的性能?

主要发现

  • DBN模型对噪声表现出鲁棒性,在18种噪声中的10种下分类准确率下降不足10%,尤其在低幅值和低变异性噪声(如汽车和厨房噪声)下表现良好。
  • 变异性较高的噪声(如咖啡厅和餐厅噪声)导致更大的准确率下降,部分情况下错误率增加超过20%。
  • 令人意外的是,在'洗衣机'噪声条件下准确率略有提升,表明适度噪声可能起到正则化作用,减少过拟合。
  • 在大多数噪声条件下,整体分类准确率有所下降,但DBN的性能保持相对稳定,凸显其对噪声的内在鲁棒性。
  • 结果表明,噪声鲁棒性高度依赖于噪声特性,低变异性噪声对模型的干扰小于高变异性噪声。
  • 本研究证实,DBN可作为真实世界噪声环境中情感识别的可行框架,尤其当噪声不占主导地位时。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。