[论文解读] Joyful: Joint Modality Fusion and Graph Contrastive Learning for Multimodal Emotion Recognition
Joyful 提出了一种用于多模态情感识别的联合优化框架,整合了多模态融合、图对比学习(GCL)和端到端情感分类。它引入了一种新颖的融合机制,以同时保留全局上下文特征和模态特定特征,并采用跨视图和内视图对比学习来缓解过平滑问题并提升表征判别能力,在三个基准数据集上实现了最先进性能。
Multimodal emotion recognition aims to recognize emotions for each utterance of multiple modalities, which has received increasing attention for its application in human-machine interaction. Current graph-based methods fail to simultaneously depict global contextual features and local diverse uni-modal features in a dialogue. Furthermore, with the number of graph layers increasing, they easily fall into over-smoothing. In this paper, we propose a method for joint modality fusion and graph contrastive learning for multimodal emotion recognition (Joyful), where multimodality fusion, contrastive learning, and emotion recognition are jointly optimized. Specifically, we first design a new multimodal fusion mechanism that can provide deep interaction and fusion between the global contextual and uni-modal specific features. Then, we introduce a graph contrastive learning framework with inter-view and intra-view contrastive losses to learn more distinguishable representations for samples with different sentiments. Extensive experiments on three benchmark datasets indicate that Joyful achieved state-of-the-art (SOTA) performance compared to all baselines.
研究动机与目标
- 为解决现有基于图的方法在多模态情感识别中的局限性,特别是过平滑问题以及全局特征与单模态特征融合不佳的问题。
- 克服两阶段流水线方法在图建模前固定融合表征所导致的次优性能问题。
- 通过联合优化多模态融合、图对比学习和情感识别,提升表征判别能力。
- 通过话题感知融合机制,在整合全局上下文信息的同时保持模态特定语义。
- 通过图增强和对比学习策略提升模型的鲁棒性与泛化能力。
提出的方法
- 提出一种新型多模态融合机制,分别建模全局上下文表征与单模态特定特征,并利用与话题相关的向量以稳定时间上的上下文。
- 将单模态特征投影到共享子空间,以在保持跨模态对齐的同时保留语义丰富性。
- 引入一种图对比学习框架,包含跨视图和内视图对比损失,以增强相似与不同情感样本之间的判别能力。
- 应用图增强策略(如节点掩码、边删除)以提升学习表征的鲁棒性与泛化能力。
- 通过统一的目标函数,实现多模态融合、GCL 和情感识别的端到端优化,以达成全局优化。
- 使用动态更新的话题相关向量,以在对话轮次间保持全局上下文表征的一致性。
实验结果
研究问题
- RQ1联合优化多模态融合、图对比学习与情感识别是否能超越顺序或两阶段流水线方法的性能?
- RQ2所提出的新型融合机制在多模态对话中,能否有效保留全局上下文与模态特定特征?
- RQ3图对比学习在多模态情感识别的深层图神经网络中,能在多大程度上缓解过平滑问题?
- RQ4所提出方法在多样化的多模态情感识别基准上的泛化能力如何?
- RQ5图增强与对比学习在低资源或噪声模态设置下,对表征判别能力有何影响?
主要发现
- Joyful 在三个多模态情感识别基准数据集上实现了最先进性能,优于现有 SOTA 方法。
- 与两阶段基线相比,融合、对比学习与情感识别的联合优化显著提升了表征质量并减少了过平滑现象。
- 所提出的融合机制有效保留了全局上下文与模态特定特征,增强了特征丰富性与对齐性。
- 结合跨视图与内视图损失的图对比学习显著提升了相似与不同情感类别表征的判别能力。
- 通过有效的图增强策略,模型在噪声或模糊模态条件下表现出良好的鲁棒性与泛化能力。
- 尽管在 MSA 任务上表现不及 SOTA 基线(因后者更侧重文本模态),Joyful 在 MERC 任务上取得了更优结果,验证了其在对话级情感识别设计上的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。