Skip to main content
QUICK REVIEW

[论文解读] Fusion with Hierarchical Graphs for Mulitmodal Emotion Recognition

Shuyun Tang, Zhaojie Luo|arXiv (Cornell University)|Sep 15, 2021
Emotion and Mood Recognition参考文献 38被引用 4
一句话总结

该论文提出了一种基于图神经网络的新型模型——分层融合图卷积网络(HFGCN),通过两阶段图构建机制,结合基于注意力的边权重与关系图变换,捕捉模态间交互关系及模态-情感关联。HFGCN通过多任务学习联合预测情绪标签与唤醒度-效价(VA)值,在IEMOCAP和MELD数据集上实现了最先进性能,显著提升了分类准确率与模型可解释性。

ABSTRACT

Automatic emotion recognition (AER) based on enriched multimodal inputs, including text, speech, and visual clues, is crucial in the development of emotionally intelligent machines. Although complex modality relationships have been proven effective for AER, they are still largely underexplored because previous works predominantly relied on various fusion mechanisms with simply concatenated features to learn multimodal representations for emotion classification. This paper proposes a novel hierarchical fusion graph convolutional network (HFGCN) model that learns more informative multimodal representations by considering the modality dependencies during the feature fusion procedure. Specifically, the proposed model fuses multimodality inputs using a two-stage graph construction approach and encodes the modality dependencies into the conversation representation. We verified the interpretable capabilities of the proposed method by projecting the emotional states to a 2D valence-arousal (VA) subspace. Extensive experiments showed the effectiveness of our proposed model for more accurate AER, which yielded state-of-the-art results on two public datasets, IEMOCAP and MELD.

研究动机与目标

  • 解决传统融合方法依赖简单拼接、难以建模多模态情感识别中复杂模态间交互关系的局限性。
  • 探究模态-情感关系(即不同情绪类型下各模态的贡献程度不同)对分类性能的提升作用。
  • 通过将情感状态映射到二维唤醒度-效价(VA)子空间,提升模型可解释性。
  • 构建一种分层图融合机制,以捕捉话语级与对话级的模态交互关系。

提出的方法

  • 模型采用两阶段图构建:首先,通过基于注意力的边连接模态特异性特征(文本、语音、视频),在话语层级建模模态间交互关系。
  • 其次,通过另一组基于注意力的边连接话语表示,建模对话层级的交互关系,实现时间维度上的分层融合。
  • 显式设计边关系以编码模态-情感依赖,使模型能够学习不同模态在不同情感状态下的贡献方式。
  • 引入多任务学习损失函数,联合预测离散情绪标签与连续的唤醒度-效价(VA)值,提升表征学习能力与可解释性。
  • 应用关系图变换以捕捉对话过程中模态与情感之间的动态关系。
  • 利用具有可学习注意力权重的图卷积网络(GCNs),动态分配模态交互与关系边的重要性。

实验结果

研究问题

  • RQ1与传统早期或晚期融合方法相比,分层图融合在多模态表征学习中如何提升情感识别性能?
  • RQ2模态-情感关系(即各模态的重要性随情绪类型而变化)在多大程度上能提升分类性能?
  • RQ3联合预测离散情绪标签与连续唤醒度-效价(VA)值是否能同时提升模型准确率与可解释性?
  • RQ4基于注意力的边权重与关系图设计在捕捉模态间交互与模态-情感依赖方面分别起到何种作用?
  • RQ5话语级与对话级图结构在建模多模态情感动态中的相对贡献如何?

主要发现

  • HFGCN在IEMOCAP数据集上达到最先进性能,平均F1得分为74.90,显著优于基线方法。
  • 消融实验表明,若同时移除两阶段图构建机制,F1得分将下降超过12个百分点,证明分层融合机制的必要性。
  • 移除基于注意力的边权重导致F1下降2.7%,而移除边关系则导致F1下降3.9%,表明关系设计的重要性高于注意力权重本身。
  • 模型在二维唤醒度-效价(VA)空间中的可视化结果表明,其能捕捉一般性情感分布,但倾向于在唤醒度轴上过度泛化。
  • 误分类最常出现在如'Okay'或'I just can’t'等短语中,这些短语位于中性、愤怒与兴奋情绪的过渡区域。
  • 情绪标签与VA值的联合预测显著提升了模型可解释性,表现为预测情感状态与理论VA框架(Barrett, 1998)高度一致。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。