Skip to main content
QUICK REVIEW

[论文解读] Multi-Window Data Augmentation Approach for Speech Emotion Recognition

Sarala Padi, Dinesh Manocha|arXiv (Cornell University)|Oct 19, 2020
Emotion and Mood Recognition参考文献 39被引用 5
一句话总结

本文提出了一种用于语音情感识别(SER)的多窗口数据增强方法(MWA-SER),通过在训练过程中使用多种窗口尺寸提取音频特征,提升了模型的泛化能力。通过多尺度窗口化生成额外的训练样本,该方法在IEMOCAP、SAVEE和RAVDESS数据集上均提升了性能,相较于单窗口基线模型,在SAVEE上最高提升了14%的准确率,在IEMOCAP上提升了6%。

ABSTRACT

We present a Multi-Window Data Augmentation (MWA-SER) approach for speech emotion recognition. MWA-SER is a unimodal approach that focuses on two key concepts; designing the speech augmentation method and building the deep learning model to recognize the underlying emotion of an audio signal. Our proposed multi-window augmentation approach generates additional data samples from the speech signal by employing multiple window sizes in the audio feature extraction process. We show that our augmentation method, combined with a deep learning model, improves speech emotion recognition performance. We evaluate the performance of our approach on three benchmark datasets: IEMOCAP, SAVEE, and RAVDESS. We show that the multi-window model improves the SER performance and outperforms a single-window model. The notion of finding the best window size is an essential step in audio feature extraction. We perform extensive experimental evaluations to find the best window choice and explore the windowing effect for SER analysis.

研究动机与目标

  • 为解决因训练数据有限导致深度学习模型在语音情感识别(SER)中出现过拟合的问题。
  • 探究窗口尺寸选择对音频特征提取及SER性能的影响。
  • 开发一种无需依赖复杂生成模型的数据增强策略,以生成多样化且信息丰富的训练样本。
  • 在IEMOCAP、SAVEE和RAVDESS等多个基准数据集上,在一致的实验设置下评估所提出方法。
  • 识别在不同数据集和情感类别下提升情感识别性能的最优窗口尺寸组合。

提出的方法

  • 该方法在音频特征提取中采用多窗口策略,使用25ms、50ms、100ms和200ms四种窗口尺寸,在多个时间尺度上生成特征。
  • 每个窗口尺寸产生一组独立的特征,有效将训练样本数量增加为所用窗口尺寸数量的倍数。
  • 使用一维卷积神经网络(CNN)在增强的特征集合上进行训练,以对语音信号中的情感进行分类。
  • 该方法应用于三个基准数据集:IEMOCAP、SAVEE和RAVDESS,采用一致的模型架构和训练协议。
  • 该方法避免依赖生成对抗网络(GANs)或复杂信号变换,转而通过窗口化实现对信号内在变化的捕捉。
  • 在不同组合(如三窗口、四窗口)下评估窗口化策略,以确定各数据集的最优配置。

实验结果

研究问题

  • RQ1与单窗口特征提取相比,多窗口数据增强在SER性能上表现如何?
  • RQ2在不同数据集中,最大化情感识别准确率的最优窗口尺寸组合是什么?
  • RQ3窗口化处理如何影响提取特征在SER中的判别能力?
  • RQ4为何某些情感类别(如“快乐”或“兴奋”)的误分类率较高,多窗口处理如何影响这一现象?
  • RQ5多窗口增强方法是否能在具有不同信号时长和情感分布的多样化数据集中实现泛化?

主要发现

  • 在IEMOCAP数据集上,多窗口模型相较于单窗口基线,准确率提升了6%,WAP提升了9%,WAF1提升了7%。
  • 在SAVEE数据集上,多窗口方法在准确率上实现了14%的提升,WAP提升7%,WAF1提升12%,表明在该数据集上性能增益显著。
  • 在RAVDESS数据集上,多窗口模型在准确率、WAP和WAF1上均提升了2%,显示出一致但相较于IEMOCAP和SAVEE更温和的增益。
  • “快乐”和“兴奋”类别在IEMOCAP中尤其容易与“中性”混淆,原因在于其持续时间较短且语音特征重叠。
  • “悲伤”和“中性”类别在所有三个数据集中均表现出较高的混淆率,表明其在语调和频谱特征上存在固有的感知相似性。
  • 最优窗口尺寸组合因数据集而异:IEMOCAP(实验1)为50、100、200ms;IEMOCAP(实验2)为25、50、100ms;SAVEE为100和200ms;RAVDESS为25、50、100、200ms。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。