Skip to main content
QUICK REVIEW

[论文解读] Joint Deep Cross-Domain Transfer Learning for Emotion Recognition

Dung Nguyen, Sridha Sridharan|arXiv (Cornell University)|Mar 24, 2020
Emotion and Mood Recognition参考文献 29被引用 10
一句话总结

本文提出了一种联合深度跨域迁移学习框架,通过三种监督信号同时优化多个资源匮乏、互不重叠的数据集上的情感识别:两个情感分类器(交叉熵损失)和一种情感匹配信号(对比损失)。通过联合学习跨域和跨数据集的特征,该模型在eNTERFACE和SAVEE数据集上实现了80%的平均准确率,显著优于最先进基线方法,并展现出对分布偏移的鲁棒性。

ABSTRACT

Deep learning has been applied to achieve significant progress in emotion recognition. Despite such substantial progress, existing approaches are still hindered by insufficient training data, and the resulting models do not generalize well under mismatched conditions. To address this challenge, we propose a learning strategy which jointly transfers the knowledge learned from rich datasets to source-poor datasets. Our method is also able to learn cross-domain features which lead to improved recognition performance. To demonstrate the robustness of our proposed framework, we conducted experiments on three benchmark emotion datasets including eNTERFACE, SAVEE, and EMODB. Experimental results show that the proposed method surpassed state-of-the-art transfer learning schemes by a significant margin.

研究动机与目标

  • 解决情感识别中标签数据有限的挑战,特别是在训练和测试数据集互不重叠且存在分布偏移的情况下。
  • 克服现有迁移学习方法仅在单一模态(如视觉或音频)内迁移知识的局限性,并无法在不同领域间泛化的问题。
  • 开发一种统一的深度学习框架,联合学习跨域(如视觉到音频)和跨数据集特征,以提升模型泛化能力。
  • 通过一种新颖的联合损失函数,实现在多个资源匮乏数据集上的端到端训练,以最小化类内方差并最大化类间方差。
  • 在三个基准数据集eNTERFACE、SAVEE和EMODB上,通过多模态情感识别验证该框架的有效性。

提出的方法

  • 提出一种具有三种监督信号的联合学习框架:每个领域一个情感分类器(使用交叉熵损失),以及一种用于匹配相同情感样本对的对比损失。
  • 采用双分支网络架构,每个分支处理来自不同数据集或模态的数据,从而实现在不同领域间的联合特征学习。
  • 引入组归一化(GN)以稳定训练过程并提升性能,尤其在低数据环境下表现更优。
  • 采用小批量大小为2以减少内存消耗,同时保持性能,从而实现在有限GPU资源下的高效训练。
  • 通过从预训练模型进行连续微调,使用小批量配对样本学习对比嵌入,而无需从头开始训练。
  • 利用对比损失最小化类内距离并最大化类间距离,促进鲁棒且可泛化的特征表示学习。

实验结果

研究问题

  • RQ1联合深度跨域学习框架能否有效实现多个资源匮乏且互不重叠的数据集之间的情感知识迁移?
  • RQ2联合优化交叉熵损失和对比损失相比单损失或顺序训练策略,如何提升模型泛化能力?
  • RQ3所提出的方法在多大程度上能够缓解eNTERFACE和SAVEE等不同情感数据集之间的分布偏移问题?
  • RQ4使用小批量大小(2)是否会影响性能,还是仍能实现在低资源环境下的有效学习和高准确率?
  • RQ5通过学习共享的跨域表示,该框架是否能在模态之间实现泛化,例如从视觉模态到音频模态?

主要发现

  • 所提出的联合学习模型在eNTERFACE(94%)和SAVEE(66%)数据集上实现了80%的平均情感识别准确率,显著优于基线模型。
  • 仅使用交叉熵损失联合eNTERFACE和SAVEE数据的V_SAV_eNTER_Model仅达到64%的平均准确率,表明简单拼接数据无法解决分布偏移问题。
  • 使用小批量大小为2对预训练模型进行微调,可获得具有竞争力的性能,证明该方法内存效率高,适用于低资源训练。
  • 对比损失组件有效降低了类内方差并增加了类间方差,从而促进了跨数据集更具判别性的特征学习。
  • 该模型在不同领域之间泛化良好,包括从视觉到音频模态,显示出成功的跨域知识迁移能力。
  • 据作者所知,这是首个在单一端到端框架中联合学习跨域和跨数据集特征的资源匮乏数据集情感识别方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。