Skip to main content
QUICK REVIEW

[论文解读] Learning Discriminative features using Center Loss and Reconstruction as Regularizer for Speech Emotion Recognition

Suraj Tripathi, Abhiram Ramesh|arXiv (Cornell University)|Jun 19, 2019
Speech and Audio Processing参考文献 23被引用 8
一句话总结

该论文提出了一种基于CNN的语音情感识别模型,通过联合优化Softmax损失和中心损失来学习判别性特征,同时将输入特征的重建作为辅助正则化任务。该方法通过多任务学习增强特征判别性和泛化能力,在参数量更少的情况下实现了最先进性能。

ABSTRACT

This paper proposes a Convolutional Neural Network (CNN) inspired by Multitask Learning (MTL) and based on speech features trained under the joint supervision of softmax loss and center loss, a powerful metric learning strategy, for the recognition of emotion in speech. Speech features such as Spectrograms and Mel-frequency Cepstral Coefficient s (MFCCs) help retain emotion-related low-level characteristics in speech. We experimented with several Deep Neural Network (DNN) architectures that take in speech features as input and trained them under both softmax and center loss, which resulted in highly discriminative features ideal for Speech Emotion Recognition (SER). Our networks also employ a regularizing effect by simultaneously performing the auxiliary task of reconstructing the input speech features. This sharing of representations among related tasks enables our network to better generalize the original task of SER. Some of our proposed networks contain far fewer parameters when compared to state-of-the-art architectures.

研究动机与目标

  • 通过度量学习学习更具判别性的声学特征,以提升语音情感识别(SER)性能。
  • 通过输入语音特征的辅助重建任务,缓解过拟合并提升SER模型的泛化能力。
  • 通过设计轻量级架构,在不牺牲性能的前提下降低模型复杂度。
  • 探索在多任务学习框架中,将中心损失与重建损失结合的有效性。
  • 验证在低资源情感识别设置下,多个任务间共享表示可带来更好的泛化性能。

提出的方法

  • 使用Softmax损失和中心损失的联合监督,在如频谱图和MFCC等语音特征上训练CNN。
  • 应用中心损失,通过将同一类别的嵌入拉向其类别中心,以最小化类内方差。
  • 引入一个辅助重建任务,使网络从瓶颈层学习重建输入语音特征。
  • 在主分类任务和重建任务之间共享相同的特征提取器,以促进鲁棒表示学习。
  • 使用多任务损失函数,结合交叉熵(Softmax)损失和中心损失,并将重建损失作为正则化项。
  • 采用轻量级架构,参数量少于最先进模型,同时保持高性能。

实验结果

研究问题

  • RQ1联合优化Softmax损失和中心损失是否能提升语音情感识别中的判别性特征学习?
  • RQ2作为辅助任务添加重建损失是否能增强模型泛化能力并减少过拟合?
  • RQ3在使用多任务学习时,轻量级CNN架构在参数更少的情况下能达到多大程度的竞争力?
  • RQ4中心损失与重建损失的结合如何影响学习嵌入中的类内紧凑性和类间可分性?
  • RQ5在分类与重建任务之间共享表示是否能提升低资源SER基准上的性能?

主要发现

  • 所提出的模型在语音情感识别基准上实现了最先进性能,且参数量显著减少。
  • 联合训练中心损失与重建损失使嵌入空间中的类内聚类更紧凑,类间分离更明显。
  • 重建损失作为有效的正则化项,提升了泛化能力并减少了过拟合,尤其在数据量较少的情况下。
  • 该模型在标准SER数据集上优于现有架构,即使参数更少,也证明了多任务设计的有效性。
  • 使用中心损失显著提升了分类准确率,增强了学习特征的判别能力。
  • 消融实验确认,中心损失与重建损失均独立且协同地促进了性能提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。