Skip to main content
QUICK REVIEW

[论文解读] Cross Lingual Cross Corpus Speech Emotion Recognition

Shivali Goel, Homayoon Beigi|arXiv (Cornell University)|Mar 18, 2020
Emotion and Mood Recognition参考文献 24被引用 15
一句话总结

本文通过多任务学习框架研究了跨语言和跨语料库的语音情感识别(SER),该框架联合预测情感与语言身份。研究发现,IS09特征优于MFCC,迁移学习在小数据集上表现更优,而将语言ID作为辅助任务并未带来显著提升——表明在四种语言中,语音情感表达在很大程度上与语言无关。

ABSTRACT

The majority of existing speech emotion recognition models are trained and evaluated on a single corpus and a single language setting. These systems do not perform as well when applied in a cross-corpus and cross-language scenario. This paper presents results for speech emotion recognition for 4 languages in both single corpus and cross corpus setting. Additionally, since multi-task learning (MTL) with gender, naturalness and arousal as auxiliary tasks has shown to enhance the generalisation capabilities of the emotion models, this paper introduces language ID as another auxiliary task in MTL framework to explore the role of spoken language on emotion recognition which has not been studied yet.

研究动机与目标

  • 为解决在一种语料库或语言上训练的模型应用于不同语料库时SER性能下降的问题。
  • 探究口语语言是否影响语音中的情感表达,这一因素在SER研究中极少被关注。
  • 评估迁移学习与多任务学习(MTL)的有效性,其中性别、自然度、唤醒度和语言ID作为辅助任务。
  • 在一致的特征集和数据划分下,比较传统机器学习(SVC)与深度学习(LSTM)的性能。
  • 评估在多种语言的多样化、低资源及表演式语音语料库中的泛化能力。

提出的方法

  • 使用了五个多样化的语音情感识别数据集:EMO-DB(德语)、SAVEE(英语)、EMOVO(意大利语)、MASC(普通话)和IEMOCAP(英语)。
  • 提取IS09和MFCC特征;采用逻辑回归、SVC和LSTM分类器进行基线实验与迁移学习实验。
  • 通过在IEMOCAP(大规模英语语料库)上预训练并在较小数据集上微调来实现迁移学习。
  • 设计了一个多任务学习框架,模型通过共享的LSTM主干网络联合预测情感与语言ID。
  • 在标准化的训练-测试划分下,通过准确率分数评估跨语料库和跨语言设置下的性能。
  • 通过消融研究比较单任务与多任务模型,并在相同数据划分和预处理条件下与先前工作进行结果验证。

实验结果

研究问题

  • RQ1在多种语言中,SER模型性能在单语料库与跨语料库设置下的差异如何?
  • RQ2在多任务学习中引入语言识别作为辅助任务是否能提升跨语言的情感识别性能?
  • RQ3在多样化语料库和语言中,IS09与MFCC特征集哪一种能带来更好的SER性能?
  • RQ4从大规模语料库(IEMOCAP)进行迁移学习在多大程度上提升了小规模、低资源语料库的SER准确率?
  • RQ5在相同数据划分下,使用最优特征的传统机器学习模型(如SVC+IS09)是否能超越深度学习模型在SER任务中的表现?

主要发现

  • IS09特征在所有数据集中显著优于MFCC,使用SVC在EMO-DB上达到最高准确率(88.37%)。
  • 迁移学习提升了小数据集上的SER性能:在IEMOCAP上预训练后微调EMO-DB,准确率从46.51%提升至83.72%。
  • 在多任务学习中增加语言ID作为辅助任务并未提升情感识别准确率,表明情感表达在很大程度上与语言无关。
  • 使用IS09特征的传统机器学习模型(SVC)在EMO-DB上达到65.00%准确率,在IEMOCAP上达到61.00%准确率,优于相同数据划分下的先前深度学习模型。
  • 多任务模型对语言ID的预测准确率超过97%,证实语言身份可被有效学习,但其引入并未增强情感识别性能。
  • EMOVO在微调实验中性能略有下降,表明即使在相似语言家族内,也可能存在领域偏移或数据分布差异。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。