Skip to main content
QUICK REVIEW

[论文解读] Towards adversarial learning of speaker-invariant representation for speech emotion recognition

Ming Tu, Yun Tang|arXiv (Cornell University)|Mar 22, 2019
Emotion and Mood Recognition参考文献 20被引用 17
一句话总结

本文提出使用领域对抗性训练(DAT)和交叉梯度训练(CGT)进行对抗性训练,以学习语音情感识别(SER)中的说话人无关表征。通过联合训练情感分类器与说话人分类器,并利用梯度反转或梯度引导的数据增强,模型能够解耦说话人特异性因素,从而提升对未见说话人的泛化能力。在IEMOCAP数据集上,DAT和CGT分别相较基线模型实现5.6%和7.4%的相对准确率提升,且DAT在无目标说话人数据的情况下仍表现出强鲁棒性。

ABSTRACT

Speech emotion recognition (SER) has attracted great attention in recent years due to the high demand for emotionally intelligent speech interfaces. Deriving speaker-invariant representations for speech emotion recognition is crucial. In this paper, we propose to apply adversarial training to SER to learn speaker-invariant representations. Our model consists of three parts: a representation learning sub-network with time-delay neural network (TDNN) and LSTM with statistical pooling, an emotion classification network and a speaker classification network. Both the emotion and speaker classification network take the output of the representation learning network as input. Two training strategies are employed: one based on domain adversarial training (DAT) and the other one based on cross-gradient training (CGT). Besides the conventional data set, we also evaluate our proposed models on a much larger publicly available emotion data set with 250 speakers. Evaluation results show that on IEMOCAP, DAT and CGT provides 5.6% and 7.4% improvement respectively, over a baseline system without speaker-invariant representation learning on 5-fold cross validation. On the larger emotion data set, while CGT fails to yield better results than baseline, DAT can still provide 9.8% relative improvement on a standalone test set.

研究动机与目标

  • 为解决语音情感识别(SER)中说话人差异带来的挑战,该挑战会阻碍模型对未见说话人的泛化能力。
  • 在训练过程中无需使用标注或未标注的目标说话人数据,学习说话人无关的表征。
  • 评估对抗性训练策略——DAT和CGT——在SER领域泛化中的有效性。
  • 在小规模(IEMOCAP)和大规模(250名说话人)普通话情感数据集上,比较DAT和CGT的性能。

提出的方法

  • 模型采用三部分架构:基于TDNN和LSTM的表征学习网络,结合统计池化,后接独立的情感分类头和说话人分类头。
  • 对于DAT,对说话人分类器应用梯度反转层(GRL),以最小化学习表征中的说话人信息,同时保持情感分类性能。
  • 对于CGT,利用对抗任务的梯度生成领域引导的扰动,作为数据增强手段以提升领域泛化能力。
  • 表征学习网络通过端到端训练,同时优化情感分类和说话人分类目标,使用带Nesterov动量的随机梯度下降。
  • 训练过程包含100个周期,基于验证集性能进行早停。
  • 将两种训练策略——DAT和CGT——与仅SER的基线模型以及多任务学习(MTL)基线进行比较。

实验结果

研究问题

  • RQ1在无需目标说话人数据的情况下,使用领域对抗性训练(DAT)的对抗性训练能否提升语音情感识别模型对未见说话人的泛化能力?
  • RQ2在低资源说话人设置下,基于梯度引导数据增强的领域泛化方法——交叉梯度训练(CGT)——是否优于基线模型?
  • RQ3当训练说话人数量增加时(如250名说话人的大规模数据集),DAT与CGT在泛化性能上的表现如何比较?
  • RQ4所学习的表征在多大程度上实现了说话人无关性?是否可通过t-SNE嵌入可视化?

主要发现

  • 在IEMOCAP数据集上,DAT相较仅SER的基线模型实现5.6%的相对准确率提升,而CGT实现7.4%的相对提升。
  • 在包含250名说话人的更大规模普通话语音情感数据集上,DAT在独立测试集上仍实现9.8%的相对准确率提升,表明其对未见说话人的强鲁棒性。
  • CGT在IEMOCAP上优于基线(7.4%提升),但在大规模数据集上未能提升性能,表明其有效性在训练数据已覆盖大量说话人差异时会减弱。
  • t-SNE可视化证实,DAT成功从学习到的嵌入中去除了说话人特异性信息,生成更具说话人无关性的表征。
  • 在DAT设置下,验证集与测试集之间的性能差距最小化,表明其对未见说话人的泛化能力极强。
  • 多任务学习(MTL)在情感与说话人分类上联合训练并未带来一致性能增益,表明在缺乏对抗正则化的情况下,联合训练效果不如对抗适应策略。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。