Skip to main content
QUICK REVIEW

[论文解读] Domain adversarial learning for emotion recognition

Zheng Lian, Jianhua Tao|arXiv (Cornell University)|Oct 24, 2019
Emotion and Mood Recognition参考文献 16被引用 6
一句话总结

该论文提出了一种基于领域对抗性神经网络(DANN)的框架,用于实现与说话人无关的情感识别,通过梯度反转学习情感不变表示,以最小化说话人身份信息。该方法在IEMOCAP数据集上相较于最先进方法实现了3.48%的绝对性能提升,通过在未标注数据上进行半监督学习,展现出对未见说话人的优越泛化能力。

ABSTRACT

In practical applications for emotion recognition, users do not always exist in the training corpus. The mismatch between training speakers and testing speakers affects the performance of the trained model. To deal with this problem, we need our model to focus on emotion-related information, while ignoring the difference between speaker identities. In this paper, we look into the use of the domain adversarial neural network (DANN) to extract a common representation between different speakers. The primary task is to predict emotion labels. The secondary task is to learn a common representation where speaker identities can not be distinguished. By using the gradient reversal layer, the gradients coming from the secondary task are used to bring the representations for different speakers closer. To verify the effectiveness of the proposed method, we conduct experiments on the IEMOCAP database. Experimental results demonstrate that the proposed framework shows an absolute improvement of 3.48% over state-of-the-art strategies.

研究动机与目标

  • 解决因训练与测试说话人不匹配导致的情感识别性能下降问题。
  • 学习与说话人无关的表示,聚焦于与情感相关的特征,同时摒弃说话人特有的特征。
  • 以半监督方式利用未标注数据,提升在标注数据有限情况下的模型泛化能力。
  • 在低资源数据集上,实现对现有最先进方法在跨说话人情感识别任务中的超越。
  • 验证领域对抗学习在多模态情感识别中的有效性。

提出的方法

  • 采用多模态框架,通过注意力机制(AT-Fusion)融合音频和文本特征,生成模态加权表示。
  • 使用自注意力门控循环单元(SA-GRU)捕捉对话序列中的长距离上下文依赖关系。
  • 引入梯度反转层,对抗性地训练领域分类器以预测说话人身份,迫使特征编码器学习领域不变表示。
  • 在标注情感数据(主任务)和未标注数据(次任务)上联合训练模型,以提升鲁棒性和泛化能力。
  • 应用领域对抗训练,最小化源域(训练)与目标域(测试)说话人分布之间的差异。
  • 采用双流架构:一个用于情感分类,一个用于说话人领域分类,在反向传播过程中反转梯度,以实现跨领域表示对齐。

实验结果

研究问题

  • RQ1领域对抗学习能否有效降低情感识别模型中的说话人身份偏差?
  • RQ2与依赖说话人的基线或标准监督基线相比,所提方法在未见说话人上的性能是否得到提升?
  • RQ3在低资源情感识别设置下,未标注数据能在多大程度上提升模型泛化能力?
  • RQ4与最先进方法相比,所提出的基于DANN的框架在准确率和鲁棒性方面表现如何?
  • RQ5模型能否在抑制说话人特异性信息的同时保持情感判别性特征?

主要发现

  • 所提方法在IEMOCAP数据集上实现了82.68%的加权准确率(WA),相比之前最先进方法绝对提升了3.48%。
  • 在所有五种训练设置下,该模型均优于基线C1,尤其在训练数据减少时差距最大,表明在低资源条件下具有更好的泛化能力。
  • 减少训练数据时性能仍有所提升,表明模型能有效利用未标注数据,缓解过拟合与数据稀缺问题。
  • 即使标注数据有限,该方法仍保持高性能,证明了半监督领域对抗训练在情感识别中的有效性。
  • 梯度反转机制成功减少了学习表示中的说话人身份信息,从而实现了对未见说话人的更好泛化。
  • 该框架在所有对比中均表现出一致优势,凸显了对抗性领域对齐在多模态情感识别中的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。