Skip to main content
QUICK REVIEW

[论文解读] DialogueGCN: A Graph Convolutional Neural Network for Emotion Recognition in Conversation

Deepanway Ghosal, Navonil Majumder|arXiv (Cornell University)|Aug 30, 2019
Topic Modeling被引用 8
一句话总结

该论文提出DialogueGCN,一种图卷积网络,通过使用话语的有向图来建模对话中的说话人之间及说话人自身(自)依赖关系,以提升情绪识别性能。通过利用关系边特征捕捉长距离上下文关系,DialogueGCN在IEMOCAP、MELD和AVEC数据集上优于先前的RNN模型,取得了64.18%的SOTA F1分数和0.157的MAE。

ABSTRACT

Emotion recognition in conversation (ERC) has received much attention, lately, from researchers due to its potential widespread applications in diverse areas, such as health-care, education, and human resources. In this paper, we present Dialogue Graph Convolutional Network (DialogueGCN), a graph neural network based approach to ERC. We leverage self and inter-speaker dependency of the interlocutors to model conversational context for emotion recognition. Through the graph network, DialogueGCN addresses context propagation issues present in the current RNN-based methods. We empirically show that this method alleviates such issues, while outperforming the current state of the art on a number of benchmark emotion classification datasets.

研究动机与目标

  • 解决RNN模型在对话情绪识别(ERC)中难以捕捉长距离上下文依赖关系的局限性。
  • 建模说话人之间及说话人自身(自)依赖关系,以更好地捕捉对话中的情感动态。
  • 通过使用图神经网络而非顺序RNN,提升远距离话语间上下文传播能力。
  • 证明关系边特征(说话人与时间依赖关系)对准确情绪分类至关重要。
  • 展示模型在RNN失效的短语句或复杂情感语境中具有良好泛化能力。

提出的方法

  • 构建一个有向图,其中每个节点代表一个话语,边编码话语之间的说话人依赖关系和相对时间位置。
  • 使用两层图卷积网络(GCN)在图中传播上下文信息,实现长距离依赖建模。
  • 引入两种边关系类型:说话人层级依赖(谁对谁说话)和时间依赖(对话中的相对位置)。
  • 在图传播前,使用序列编码器(双向GRU)和说话人层级编码器学习话语和说话人特定的表示。
  • 在基准数据集上使用交叉熵损失进行端到端训练,实现多分类情绪识别。
  • 使用大小为(10,10)的上下文窗口定义话语之间的边,以捕捉过去和未来上下文。

实验结果

研究问题

  • RQ1与RNN模型相比,建模说话人之间及自依赖关系是否能提升对话情绪识别性能?
  • RQ2包含关系边特征(说话人与时间依赖关系)对模型性能有何影响?
  • RQ3图神经网络方法是否比顺序RNN更好地处理短语句或模糊语句的上下文传播?
  • RQ4模型不同组件(如序列编码器与说话人层级编码器)对整体性能的贡献程度如何?
  • RQ5当仅使用文本特征时,模型在包含多模态数据的数据集上的表现如何?

主要发现

  • DialogueGCN在IEMOCAP数据集上取得了64.18%的SOTA F1分数,显著优于先前的SOTA模型。
  • 在MELD数据集上,DialogueGCN实现了64.18%的F1分数,表明其在多样化对话语境中具有强大泛化能力。
  • 在AVEC数据集上,DialogueGCN实现了0.157的平均绝对误差(MAE),优于先前的SOTA方法。
  • 消融实验表明,若同时移除序列编码器与说话人层级编码器,F1分数将降至36.75%,证实二者在上下文建模中的关键作用。
  • 当语境合适时,该模型能正确将短语如'okay'分类为'frustrated',而RNN模型在类似情况下会失败。
  • 错误分析显示,误分类多发生于语义相近的情绪之间(如'frustrated'与'angry','excited'与'happy'),凸显细微情感差异的挑战。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。