Skip to main content
QUICK REVIEW

[论文解读] GraphCFC: A Directed Graph Based Cross-Modal Feature Complementation Approach for Multimodal Conversational Emotion Recognition

Jiang Li, Xiaoping Wang|arXiv (Cornell University)|Jul 6, 2022
Sentiment Analysis and Opinion Mining参考文献 41被引用 9
一句话总结

该论文提出 GraphCFC,一种基于有向图的跨模态特征互补框架,通过具有多个子空间提取器的图神经网络(GNN)和成对跨模态互补(PairCC)策略,建模长距离上下文依赖关系与模态间交互,从而提升多模态对话情感识别性能。在 IEMOCAP 和 MELD 数据集上,该方法实现了最先进性能,在三分类设定下,MELD 数据集上的准确率和 F1 分数分别较 MMGCN 提升 0.61% 和 1.20%。

ABSTRACT

Emotion Recognition in Conversation (ERC) plays a significant part in Human-Computer Interaction (HCI) systems since it can provide empathetic services. Multimodal ERC can mitigate the drawbacks of uni-modal approaches. Recently, Graph Neural Networks (GNNs) have been widely used in a variety of fields due to their superior performance in relation modeling. In multimodal ERC, GNNs are capable of extracting both long-distance contextual information and inter-modal interactive information. Unfortunately, since existing methods such as MMGCN directly fuse multiple modalities, redundant information may be generated and diverse information may be lost. In this work, we present a directed Graph based Cross-modal Feature Complementation (GraphCFC) module that can efficiently model contextual and interactive information. GraphCFC alleviates the problem of heterogeneity gap in multimodal fusion by utilizing multiple subspace extractors and Pair-wise Cross-modal Complementary (PairCC) strategy. We extract various types of edges from the constructed graph for encoding, thus enabling GNNs to extract crucial contextual and interactive information more accurately when performing message passing. Furthermore, we design a GNN structure called GAT-MLP, which can provide a new unified network framework for multimodal learning. The experimental results on two benchmark datasets show that our GraphCFC outperforms the state-of-the-art (SOTA) approaches.

研究动机与目标

  • 为解决单模态和直接融合型多模态方法在对话情感识别(ERC)中的局限性,特别是信息多样性损失与特征融合冗余问题。
  • 通过在文本、音频和视觉输入之间实现动态、互补的特征学习,减少多模态融合中模态间的异质性差距。
  • 比现有基于 GNN 的方法(如 MMGCN)更有效地建模长距离上下文依赖关系与模态间交互。
  • 设计一种统一的 GNN 架构 GAT-MLP,以支持对话系统中稳健的多模态表征学习。
  • 通过缓解情感漂移问题并增强对细微或模糊情感状态的识别能力,提升基准数据集上的性能。

提出的方法

  • 构建一个有向图,其中节点表示话语,边编码模态内(上下文)和模态间(交互)关系。
  • 应用多个子空间提取器,将不同模态映射到共享但互异的低维空间,以减少模态异质性。
  • 实施成对跨模态互补(PairCC)策略,显式建模某一模态的特征如何补充另一模态中缺失或模糊的信号。
  • 设计 GAT-MLP 架构,结合图注意力机制与多层感知机,学习跨模态与对话历史的动态、注意力加权表征。
  • 在图中使用消息传递机制传播并优化表征,使模型能够捕捉长距离依赖关系与跨说话人动态。
  • 使用交叉熵损失端到端训练模型,进行多分类情感识别,输入为多模态对话数据。

实验结果

研究问题

  • RQ1基于有向图的方法是否能比现有 GNN 更好地建模多模态对话中的上下文与交互信息?
  • RQ2跨模态特征互补在多大程度上能减少文本、音频与视觉模态在情感识别中的异质性差距?
  • RQ3GraphCFC 在多大程度上缓解了单模态与早期融合模型中常见的‘情感漂移’问题?
  • RQ4所提出的 GAT-MLP 架构是否相比先前基于 GNN 的模型,提供了更有效且统一的多模态学习框架?
  • RQ5GraphCFC 是否能在不同情感标签体系下实现良好泛化,例如粗粒度(三分类)与细粒度(六或七分类)标签?

主要发现

  • 在 IEMOCAP 数据集的三分类设定下,GraphCFC 达到 88.48% 的准确率与 80.20% 的加权 F1 分数,较 MMGCN 在准确率上提升 0.61%,F1 分数提升 1.20%。
  • 在 MELD 数据集上,GraphCFC 实现 75.12% 的准确率与 68.12% 的加权 F1 分数,较 MMGCN 在准确率上提升 0.61 个百分点,F1 分数提升 1.20 个百分点。
  • 案例研究显示,GraphCFC 能够正确识别如 'Excited' 或 'Sad' 等情感强烈的语句,而这些语句常被单模态或早期融合模型误分类为 'Neutral'。
  • 该模型通过利用跨模态线索,有效减少了情感漂移错误——这类错误常见于 MMGCN 等模型在连续出现中性话语后默认输出 'Neutral' 的问题。
  • PairCC 策略与多个子空间提取器显著提升了特征互补效果,尤其在某一模态存在模糊或噪声时表现更优。
  • GAT-MLP 架构在 IEMOCAP 与 MELD 数据集上均表现出一致的性能增益,证明其在表征学习方面的优越性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。