Skip to main content
QUICK REVIEW

[论文解读] GA2MIF: Graph and Attention Based Two-Stage Multi-Source Information Fusion for Conversational Emotion Detection

Jiang Li, Xiaoping Wang|arXiv (Cornell University)|Jul 25, 2022
Sentiment Analysis and Opinion Mining参考文献 48被引用 4
一句话总结

该论文提出GA2MIF,一种用于对话情感识别的两阶段多模态融合框架,采用多头定向图注意力(MDGAT)进行模态内上下文建模,以及多头成对跨模态注意力(MPCAT)进行模态间交互。通过利用上下文窗口减少冗余连接并避免异质图输入问题,GA2MIF在IEMOCAP数据集上实现了70.00%的SOTA加权F1分数,显著优于先前的SOTA模型。

ABSTRACT

Multimodal Emotion Recognition in Conversation (ERC) plays an influential role in the field of human-computer interaction and conversational robotics since it can motivate machines to provide empathetic services. Multimodal data modeling is an up-and-coming research area in recent years, which is inspired by human capability to integrate multiple senses. Several graph-based approaches claim to capture interactive information between modalities, but the heterogeneity of multimodal data makes these methods prohibit optimal solutions. In this work, we introduce a multimodal fusion approach named Graph and Attention based Two-stage Multi-source Information Fusion (GA2MIF) for emotion detection in conversation. Our proposed method circumvents the problem of taking heterogeneous graph as input to the model while eliminating complex redundant connections in the construction of graph. GA2MIF focuses on contextual modeling and cross-modal modeling through leveraging Multi-head Directed Graph ATtention networks (MDGATs) and Multi-head Pairwise Cross-modal ATtention networks (MPCATs), respectively. Extensive experiments on two public datasets (i.e., IEMOCAP and MELD) demonstrate that the proposed GA2MIF has the capacity to validly capture intra-modal long-range contextual information and inter-modal complementary information, as well as outperforms the prevalent State-Of-The-Art (SOTA) models by a remarkable margin.

研究动机与目标

  • 解决现有对话情感识别多模态模型在处理异质模态输入和冗余图连接方面的局限性。
  • 通过有效建模各模态内的长距离上下文依赖关系以及模态间的互补信息,提升情感识别准确率。
  • 克服先前图神经网络模型(如MMGCN)的缺陷,后者将所有模态视为同质节点,违反图神经网络的基本假设。
  • 通过优化的注意力机制和结构化融合策略,降低相似情感(如Sad与Frustrated)的误分类率。
  • 在公开基准数据集IEMOCAP和MELD上,验证模型在两模态与三模态设置下的优越性能。

提出的方法

  • 采用多头定向图注意力网络(MDGAT)分别对文本、语音和视觉模态中的长距离依赖关系进行建模。
  • 引入上下文窗口机制,构建稀疏且有意义的模态间连接,替代全连接图结构,以减少冗余。
  • 应用多头成对跨模态注意力网络(MPCAT)在话语层级上捕捉不同模态间的互补交互。
  • 设计一种新型的Sum-Product更新函数用于MDGAT,以增强图注意力机制中的特征聚合能力。
  • 实施两阶段融合策略:首先通过MDGAT建模模态内上下文,再通过MPCAT实现模态间融合以获得跨模态理解。
  • 使用模态特定的嵌入作为输入,注意力机制动态加权时序和模态维度上的相关特征。

实验结果

研究问题

  • RQ1两阶段图注意力融合框架是否能有效建模多模态对话数据中的模态内长距离依赖?
  • RQ2与全连接图相比,使用上下文窗口构建边是否能在保持关键上下文关系的同时更有效地减少冗余?
  • RQ3MDGAT与MPCAT联合使用,相较于同质图模型,能否显著提升跨模态交互与情感识别性能?
  • RQ4与现有SOTA模型相比,所提出的GA2MIF模型是否能有效降低Sad与Frustrated等相似情感的误分类率?
  • RQ5在不同模态组合(如文本-语音、文本-视觉、全三模态)下,该模型在基准数据集上的表现如何?

主要发现

  • 在IEMOCAP数据集上,GA2MIF实现了70.00%的加权F1分数,显著优于所有基线模型(包括MMGCN),尤其在三模态设置下表现突出。
  • 在IEMOCAP数据集上,语音-文本设置的准确率为67.47%,F1分数为67.49%,较视觉-文本设置分别高出7.77和7.64个百分点。
  • 与MMGCN相比,GA2MIF将真实标签为Sad却被误分类为Frustrated的错误率降低了7.75%,从15.51%降至7.76%。
  • 在IEMOCAP和MELD两个数据集上,三模态设置始终优于所有两模态设置,验证了完整多模态融合的优势。
  • GA2MIF在不同数据集上展现出强鲁棒性与泛化能力,在IEMOCAP和MELD上均达到SOTA性能,且在准确率与F1分数上保持一致提升。
  • 消融实验表明,MDGAT与MPCAT均对性能有显著贡献,且上下文窗口机制有效减少了冗余连接,同时未降低模型容量。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。