Skip to main content
QUICK REVIEW

[论文解读] Speech Emotion Recognition Based on Multi-feature and Multi-lingual Fusion

Chunyi Wang|arXiv (Cornell University)|Jan 16, 2020
Emotion and Mood Recognition参考文献 16被引用 4
一句话总结

本文提出了一种多特征与多语言融合方法,用于在低资源条件下提升语音情感识别的准确率。通过结合中文和英文语音数据集中的手工设计特征与深度神经网络特征,并在语言内与语言间两个层面进行融合,该方法在小样本数据集上显著优于基线模型,显著提升了识别准确率。

ABSTRACT

A speech emotion recognition algorithm based on multi-feature and Multi-lingual fusion is proposed in order to resolve low recognition accuracy caused by lack of large speech dataset and low robustness of acoustic features in the recognition of speech emotion. First, handcrafted and deep automatic features are extracted from existing data in Chinese and English speech emotions. Then, the various features are fused respectively. Finally, the fused features of different languages are fused again and trained in a classification model. Distinguishing the fused features with the unfused ones, the results manifest that the fused features significantly enhance the accuracy of speech emotion recognition algorithm. The proposed solution is evaluated on the two Chinese corpus and two English corpus, and is shown to provide more accurate predictions compared to original solution. As a result of this study, the multi-feature and Multi-lingual fusion algorithm can significantly improve the speech emotion recognition accuracy when the dataset is small.

研究动机与目标

  • 解决因缺乏大规模语音数据集而导致的语音情感识别准确率低下的问题。
  • 通过跨语言整合多样化特征类型,增强声学特征的鲁棒性。
  • 通过多语言数据融合,提升模型的泛化能力与性能。
  • 评估特征融合策略在低资源环境下的有效性。
  • 证明在不同语言间结合手工设计特征与深度特征可显著提升识别准确率。

提出的方法

  • 从现有的中文与英文语音情感识别数据集中提取手工设计特征(如:韵律特征、谱特征)与深度神经网络特征(如:来自DNN的特征)。
  • 在每种语言内部独立进行多种特征类型的融合,以增强表征能力。
  • 通过语言间融合,将中文与英文的融合特征结合,生成统一的跨语言表征。
  • 在最终的融合特征表示上训练分类模型,以预测情感类别。
  • 将融合后的特征与未融合的特征进行对比,以验证融合策略的有效性。
  • 在两个中文与两个英文的语音情感语料库上进行评估,以确保跨语言泛化能力。

实验结果

研究问题

  • RQ1结合手工设计特征与深度特征是否能提升语音情感识别的准确率?
  • RQ2将中文与英文数据集的特征进行多语言融合,是否能提升模型性能?
  • RQ3在训练数据有限的情况下,特征融合对识别准确率有何影响?
  • RQ4所提出的融合策略是否比单独使用某种特征类型或单一语言数据更有效?
  • RQ5在低资源环境下,跨语言特征融合在多大程度上提升了模型的鲁棒性与泛化能力?

主要发现

  • 与使用未融合或单一特征表示的模型相比,所提出的多特征与多语言融合方法显著提升了语音情感识别的准确率。
  • 来自中文与英文数据集的融合特征,相比单一语言的特征,能生成更具鲁棒性与判别性的表征。
  • 该方法在小样本数据集上实现了更高的准确率,表现出跨语言的强泛化能力。
  • 手工设计特征与深度特征的结合显著提升了模型性能,尤其在数据量有限的场景下。
  • 在两个中文与两个英文语料库上的实证结果表明,该方法在多样化数据集上均实现了稳定的性能提升。
  • 研究证实,对已融合的特征进行语言间融合,其效果优于仅进行语言内融合。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。