Skip to main content
QUICK REVIEW

[论文解读] Towards Speech Emotion Recognition "in the wild" using Aggregated Corpora and Deep Multi-Task Learning

Jaebok Kim, Gwenn Englebienne|arXiv (Cornell University)|Aug 13, 2017
Emotion and Mood Recognition参考文献 25被引用 17
一句话总结

本文提出了一种用于在真实环境中进行语音情感识别(SER)的深度多任务学习(MTL)框架,通过联合训练情感识别、性别和自然度作为辅助任务,利用聚合的多样化语音语料库进行训练。该方法在跨语料库设置下显著提升了泛化能力,联合MTL模型相比单任务学习在未加权准确率上最高提升了17.3个百分点,并在特征空间中生成了更具判别性的高层情感表征。

ABSTRACT

One of the challenges in Speech Emotion Recognition (SER) "in the wild" is the large mismatch between training and test data (e.g. speakers and tasks). In order to improve the generalisation capabilities of the emotion models, we propose to use Multi-Task Learning (MTL) and use gender and naturalness as auxiliary tasks in deep neural networks. This method was evaluated in within-corpus and various cross-corpus classification experiments that simulate conditions "in the wild". In comparison to Single-Task Learning (STL) based state of the art methods, we found that our MTL method proposed improved performance significantly. Particularly, models using both gender and naturalness achieved more gains than those using either gender or naturalness separately. This benefit was also found in the high-level representations of the feature space, obtained from our method proposed, where discriminative emotional clusters could be observed.

研究动机与目标

  • 为解决语音情感识别(SER)在真实环境中面临的领域偏移问题,即训练数据与测试数据在说话人、任务和录音条件上存在显著差异。
  • 通过利用情感语音语料库中普遍存在的辅助任务——性别和自然度,提升模型的泛化能力。
  • 在语料内和跨语料设置下评估多任务学习的有效性,模拟真实世界中的‘在野’部署场景。
  • 探究MTL共享表征是否能带来更具判别性的高层特征,以用于情感分类。

提出的方法

  • 将多个多样化的情感语音语料库(AIBO、EMODB、ENTERFACE、LDC、IEMOCAP)聚合为单一训练集,以模拟真实世界的数据多样性。
  • 设计了一种基于深度神经网络(DNN)和LSTM的架构,主任务为情感分类,性别和自然度为辅助任务。
  • 在所有任务间共享低层网络以学习共享表征,同时为高层分类保留任务特定的网络层。
  • 使用联合损失函数端到端训练模型,该损失函数结合了所有三个任务(情感、性别、自然度)的交叉熵损失。
  • 应用t分布随机邻域嵌入(t-SNE)可视化高层特征表征,评估情感类别聚类的可分性。
  • 使用未加权准确率(UA)和混淆矩阵,在语料内与跨语料测试设置下定量评估性能。

实验结果

研究问题

  • RQ1在跨语料设置下,将性别和自然度作为辅助任务的多任务学习是否能提升语音情感识别模型的泛化能力?
  • RQ2将性别和自然度作为子任务是否能提升特征空间中情感语音的高层表征的判别性?
  • RQ3在语料内和跨语料评估中,多任务学习的性能与单任务学习相比如何?
  • RQ4同时使用性别和自然度作为子任务是否相比仅使用其中一个子任务带来性能增益?
  • RQ5当应用于未见语料时,多任务学习是否会损害泛化能力,还是能持续提升鲁棒性?

主要发现

  • 在跨语料设置下,DNN-MTL模型相比DNN-STL在未加权准确率上提升了17.3个百分点(从35.9%提升至53.4%),其中悲伤(70%)和愤怒(47%)情绪的增益最为显著。
  • 在跨语料评估中,LSTM-MTL模型相比LSTM-STL在未加权准确率上提升了6.3个百分点(从56.5%提升至62.8%),表明在不同网络结构中均表现出一致的性能增益。
  • 同时将性别和自然度作为子任务(ALL-MTL)时性能提升最高,且未出现泛化性能下降,优于仅使用单一辅助任务的模型。
  • t-SNE可视化显示,MTL模型在中性、快乐、悲伤和愤怒情感类别上的聚类明显更可分、更具判别性,相比单任务模型。
  • 该方法在较大语料库(如AIBO和IEMOCAP)中表现尤为突出,即使在语料内评估中也取得了显著增益,表明其在大规模数据集上的可扩展性。
  • 结果表明,将性别和自然度作为子任务的MTL是一种稳健且有效的策略,可在无需访问测试数据的情况下,显著提升真实环境中SER的泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。