Skip to main content
QUICK REVIEW

[论文解读] Learning spectro-temporal features with 3D CNNs for speech emotion recognition

Jaebok Kim, Khiet P. Truong|arXiv (Cornell University)|Aug 14, 2017
Emotion and Mood Recognition参考文献 23被引用 9
一句话总结

本文提出使用3D卷积神经网络(3D CNNs)联合学习语音情感识别(SER)中的频谱-时间特征,通过更少的参数建模频谱和时间动态,优于CNN-LSTM混合模型。该方法在大规模、多样化、说话人无关的数据集上表现优异,特征空间中的类别可分性提高,且中性与愤怒情绪之间的混淆显著减少。

ABSTRACT

In this paper, we propose to use deep 3-dimensional convolutional networks (3D CNNs) in order to address the challenge of modelling spectro-temporal dynamics for speech emotion recognition (SER). Compared to a hybrid of Convolutional Neural Network and Long-Short-Term-Memory (CNN-LSTM), our proposed 3D CNNs simultaneously extract short-term and long-term spectral features with a moderate number of parameters. We evaluated our proposed and other state-of-the-art methods in a speaker-independent manner using aggregated corpora that give a large and diverse set of speakers. We found that 1) shallow temporal and moderately deep spectral kernels of a homogeneous architecture are optimal for the task; and 2) our 3D CNNs are more effective for spectro-temporal feature learning compared to other methods. Finally, we visualised the feature space obtained with our proposed method using t-distributed stochastic neighbour embedding (T-SNE) and could observe distinct clusters of emotions.

研究动机与目标

  • 解决使用深度学习建模语音情感识别(SER)中频谱-时间动态的挑战。
  • 减少对手工设计特征的依赖,并提升在大规模、多样化、说话人无关数据集上的泛化能力。
  • 评估3D CNN是否能以适中参数量有效学习短时和长时的频谱与时间特征。
  • 在真实、'真实世界'条件下,对比3D CNN与SOTA方法(如CNN-LSTM和DNN-ELM)的性能。
  • 使用t-SNE可视化并分析所学习特征的判别能力。

提出的方法

  • 该方法将一系列2D语谱图切片作为3D张量(频率、时间、通道)输入3D CNN,实现频谱与时间模式的联合学习。
  • 网络架构采用同构层,使用浅层时间卷积核和中等深度的频谱卷积核,以平衡归纳偏置与模型容量。
  • 从全连接层(softmax分类器之前)提取话语级特征,用于t-SNE可视化与分类任务。
  • 模型在七个聚合语料库上进行训练与评估,包括IEMOCAP、SEMAINE、RECOLA等,采用说话人无关设置。
  • 通过配对t检验的p值评估统计显著性,报告各类别性能的混淆矩阵。
  • 使用t-SNE可视化高维特征空间,揭示与情感类别相对应的聚类结构。

实验结果

研究问题

  • RQ13D CNN能否在参数量适中的前提下,有效学习语音情感识别中的频谱-时间特征?
  • RQ2架构设计——特别是浅层时间卷积核与深层频谱卷积核——如何影响SER中的性能表现?
  • RQ33D CNN-based特征学习是否在说话人无关的SER中优于混合CNN-LSTM及其他深度学习基线模型?
  • RQ4通过t-SNE可视化,所学习的特征在多大程度上表现出类别判别能力?
  • RQ5该模型在反映真实世界'真实场景'的不平衡、多语料库数据集上的表现如何?

主要发现

  • 在同构3D CNN架构中,浅层时间卷积核与中等深度频谱卷积核的组合在所探索的配置中表现最优。
  • 与2D-CNN-LSTM-DNN相比,3D CNN模型将'中性'与'愤怒'情绪之间的混淆降低了28%,将'中性'与'悲伤'之间的混淆降低了17%。
  • 3D CNN-DNN模型在所有评估方法中取得了最高的分类准确率,优于DNN-ELM、LSTM-ELM和2D-CNN-LSTM-DNN。
  • t-SNE可视化显示,3D CNN为每类情绪(中性、快乐、悲伤、愤怒)学习到了更具判别性、更清晰分离的聚类。
  • 尽管CNN-LSTM使用了循环记忆机制,3D CNN在频谱-时间特征学习方面仍更有效且高效。
  • 该模型在大规模、说话人无关的评估设置下表现出鲁棒性,使用多样化的真实世界语料库,表明其具有强大的泛化潜力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。