[论文解读] COGMEN: COntextualized GNN based Multimodal Emotion recognitioN
COGMEN 提出了一种基于图神经网络(GNN)的上下文感知多模态情感识别模型,利用图Transformer和自注意力机制同时捕捉局部说话人依赖关系(跨/内个人)与全局对话上下文。该模型在 IEMOCAP 数据集上实现了最先进性能,F1 分数提升 7.7%(四分类),并通过消融实验验证了局部与全局信息的关键作用。
Emotions are an inherent part of human interactions, and consequently, it is imperative to develop AI systems that understand and recognize human emotions. During a conversation involving various people, a person's emotions are influenced by the other speaker's utterances and their own emotional state over the utterances. In this paper, we propose COntextualized Graph Neural Network based Multimodal Emotion recognitioN (COGMEN) system that leverages local information (i.e., inter/intra dependency between speakers) and global information (context). The proposed model uses Graph Neural Network (GNN) based architecture to model the complex dependencies (local and global information) in a conversation. Our model gives state-of-the-art (SOTA) results on IEMOCAP and MOSEI datasets, and detailed ablation experiments show the importance of modeling information at both levels.
研究动机与目标
- 开发一种能够捕捉对话中局部说话人依赖关系与全局对话上下文的多模态情感识别系统。
- 解决现有基于 RNN 的模型和单模态模型在建模跨说话人复杂情感动态方面的局限性。
- 通过统一的 GNN 基架构融合语音、视频和文本模态,提升情感预测性能。
- 证明图Transformer在建模对话中人际与内个人情感依赖关系方面的有效性。
- 发布代码并提供可复现的结果,以促进多模态情感识别领域的未来研究。
提出的方法
- 该模型使用图Transformer对话语之间的关系依赖进行编码,建模跨说话人与内说话人的情感动态。
- 采用自注意力机制从完整对话序列中捕捉长距离全局上下文。
- 模态特征(文本、语音、视频)分别处理,随后通过晚期交互策略融合,再进行图编码。
- 共享情感分类器从上下文图表示中预测每个话语的情感标签。
- 该架构在 IEMOCAP 和 MOSEI 上端到端训练,使用交叉熵损失并引入焦点加权以缓解类别不平衡问题。
- 消融实验通过受控实验验证了 GNN、全局上下文与多模态融合的贡献。
实验结果
研究问题
- RQ1基于 GNN 的架构在多模态对话中对局部(跨/内说话人)与全局(对话级)情感依赖关系的建模效果如何?
- RQ2局部依赖关系与全局上下文在提升多模态情感识别性能方面的相对贡献是什么?
- RQ3多模态融合在多模态情感识别中的增益程度如何,是否显著优于单模态或早期融合基线?
- RQ4所提出的基于图Transformer的架构与基于 RNN 或 GCN 的模型相比,在捕捉情感动态方面表现如何?
- RQ5该模型是否能在 IEMOCAP 和 MOSEI 等多样化数据集上保持最先进性能,实现良好泛化?
主要发现
- 与之前最先进方法相比,COGMEN 在 IEMOCAP(四分类)数据集上的 F1 分数绝对提升了 7.7%。
- 消融实验确认,局部(说话人依赖)与全局(上下文)信息均至关重要,任一缺失均导致性能显著下降。
- 该模型在 IEMOCAP 和 MOSEI 数据集上均优于强基线模型,如 bc-LSTM、Af-CAN 和 DialogueGCN。
- 多模态融合持续提升性能,当三种模态(文本、语音、视频)全部使用时,增益最大。
- 错误分析显示,误分类主要发生在语义相近的情感类别之间,表明在细粒度情感区分方面仍有改进空间。
- 在线推理实验中,受限于上下文窗口的短对话表现出性能下降,凸显完整对话上下文对最优性能的关键作用。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。