Skip to main content
QUICK REVIEW

[论文解读] MMGCN: Multimodal Fusion via Deep Graph Convolution Network for Emotion Recognition in Conversation

Jingwen Hu, Yuchen Liu|arXiv (Cornell University)|Jul 14, 2021
Sentiment Analysis and Opinion Mining参考文献 25被引用 5
一句话总结

该论文提出MMGCN,一种深度图卷积网络,通过融合多模态(文本、语音、视觉)特征并建模对话中的长距离上下文依赖关系与说话人特异性动态,实现了先进性能。通过构建包含跨模态连接和说话人感知连接的多模态图,并采用具有残差连接的深层谱图卷积网络,MMGCN在IEMOCAP(66.22%准确率)和MELD(58.65%准确率)数据集上均达到当前最优性能,显著优于先前方法。

ABSTRACT

Emotion recognition in conversation (ERC) is a crucial component in affective dialogue systems, which helps the system understand users' emotions and generate empathetic responses. However, most works focus on modeling speaker and contextual information primarily on the textual modality or simply leveraging multimodal information through feature concatenation. In order to explore a more effective way of utilizing both multimodal and long-distance contextual information, we propose a new model based on multimodal fused graph convolutional network, MMGCN, in this work. MMGCN can not only make use of multimodal dependencies effectively, but also leverage speaker information to model inter-speaker and intra-speaker dependency. We evaluate our proposed model on two public benchmark datasets, IEMOCAP and MELD, and the results prove the effectiveness of MMGCN, which outperforms other SOTA methods by a significant margin under the multimodal conversation setting.

研究动机与目标

  • 为解决现有模型在有效捕捉多说话人对话中多模态交互与长距离上下文依赖方面的局限性。
  • 克服简单特征拼接在多模态融合中的不足,后者无法建模跨模态交互。
  • 将说话人身份信息整合到图结构中,以建模说话人之间的依赖关系与说话人内部的依赖关系。
  • 开发一种深层谱域图卷积网络架构,实现在计算成本不过高的前提下更优的表征学习。

提出的方法

  • MMGCN在每个模态(文本、语音、视觉)内部构建全连接图,以建模跨话语的模态内依赖关系。
  • 在不同模态中代表相同话语的节点之间建立跨模态边,以实现多模态特征交互。
  • 通过说话人嵌入编码说话人身份,并将其注入图结构中,以建模说话人间与说话人内部的依赖关系。
  • 模型采用谱域图卷积网络并结合残差连接,实现深层网络架构(最多32层),以提升特征学习能力。
  • 多模态融合通过早期融合实现,即在图卷积处理前将模态特定的特征进行拼接,其性能优于晚期融合与基于注意力的方法。
  • 图卷积层能够聚合来自相邻话语与长距离话语的上下文信息,如注意力热力图所示。

实验结果

研究问题

  • RQ1深度图卷积网络能否有效建模多模态对话数据中的长距离上下文依赖?
  • RQ2将说话人身份信息引入图结构在多大程度上提升了情感识别性能?
  • RQ3基于图的多模态融合机制是否优于传统的特征拼接或基于注意力的融合方法?
  • RQ4GCN架构在多模态对话情感识别中的最优深度是多少?
  • RQ5当与MMGCN框架结合时,不同融合策略(早期融合、晚期融合、门控注意力、MFN、MulT)的比较结果如何?

主要发现

  • 在IEMOCAP数据集上,MMGCN达到66.22%的准确率,显著优于次优方法超过1.5个百分点。
  • 在MELD数据集上,MMGCN达到58.65%的准确率,创下多模态情感识别的新SOTA性能。
  • 消融实验表明,移除说话人嵌入会导致性能显著下降(IEMOCAP上为65.76%,p < 0.05),证明其重要性。
  • MMGCN的最佳深度为4层,当层数达到8层或以上时性能略有下降,表明深度与过拟合之间存在权衡。
  • 在两个数据集上,采用早期融合的MMGCN始终优于晚期融合、门控注意力、MFN与MulT,证实了其基于图的融合策略的有效性。
  • 案例研究显示,MMGCN即使在复杂且情绪强烈的对话中,也能关注到远距离话语(如第3句),展现出稳健的上下文建模能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。