Skip to main content
QUICK REVIEW

[论文解读] UniMSE: Towards Unified Multimodal Sentiment Analysis and Emotion Recognition

Guimin Hu, Ting-En Lin|arXiv (Cornell University)|Nov 21, 2022
Sentiment Analysis and Opinion Mining被引用 11
一句话总结

本文提出UniMSE,一种统一的多模态框架,通过在任务间共享特征、标签和模型,联合建模情感分析与情绪识别。通过引入预训练模态融合层、对比学习和统一的通用标签,UniMSE在四个基准数据集——MOSI、MOSEI、MELD和IEMOCAP上实现了最先进性能,展示了在多模态表征学习中更高的准确率与一致性。

ABSTRACT

Multimodal sentiment analysis (MSA) and emotion recognition in conversation (ERC) are key research topics for computers to understand human behaviors. From a psychological perspective, emotions are the expression of affect or feelings during a short period, while sentiments are formed and held for a longer period. However, most existing works study sentiment and emotion separately and do not fully exploit the complementary knowledge behind the two. In this paper, we propose a multimodal sentiment knowledge-sharing framework (UniMSE) that unifies MSA and ERC tasks from features, labels, and models. We perform modality fusion at the syntactic and semantic levels and introduce contrastive learning between modalities and samples to better capture the difference and consistency between sentiments and emotions. Experiments on four public benchmark datasets, MOSI, MOSEI, MELD, and IEMOCAP, demonstrate the effectiveness of the proposed method and achieve consistent improvements compared with state-of-the-art methods.

研究动机与目标

  • 为现有方法中将情感分析与情绪识别视为独立任务的不足提供解决方案,尽管二者在心理学和表征上具有互补性。
  • 统一多模态输入特征、输出标签与模型架构,以支持情感与情绪任务。
  • 通过在多个文本层次(句法与语义)融合语音与视觉信号,增强多模态表征学习。
  • 通过情感与情绪之间的跨模态对比学习,提升泛化能力与判别能力。
  • 在多样化的多模态基准上验证统一框架的有效性。

提出的方法

  • 提出一种统一的多模态情感-知识共享框架(UniMSE),将情感分析与情绪识别统一为单一生成任务。
  • 引入预训练模态融合(PMF)层,将语音与视觉特征与基于T5的Transformer架构中的多层次文本表征(句法与语义)进行融合。
  • 通过基于语义相似性的形式化方法,将情感与情绪映射到共享嵌入空间,定义通用标签(UL),实现联合预测。
  • 应用跨模态对比学习(CL),以最小化类内方差并最大化类间方差,增强判别性表征学习。
  • 采用基于T5的编码器-解码器结构,为情感与情绪预测任务生成统一输出。
  • 使用T-SNE可视化验证:正面情感与喜悦情绪的表征,以及原始与生成的情绪标签,共享同一特征空间。

实验结果

研究问题

  • RQ1能否基于心理学与语义相似性,在单一多模态表征空间中有效统一情感与情绪?
  • RQ2情感与情绪的联合建模是否能提升多模态情感分析与情绪识别任务的性能?
  • RQ3文本、语音与视觉特征的多层次融合在统一框架中如何增强表征学习?
  • RQ4跨模态对比学习在多大程度上提升了多模态嵌入的判别能力?
  • RQ5统一框架在MOSI、MOSEI、MELD和IEMOCAP等多样化基准上是否具备泛化能力?

主要发现

  • UniMSE在所有四个基准数据集——MOSI、MOSEI、MELD和IEMOCAP上,所有指标(MAE、相关系数(Corr)、ACC-2与F1)均达到最先进水平。
  • 在MOSI数据集上,UniMSE实现MAE为0.691,相关系数为0.809,优于先前最先进方法。
  • 消融研究显示,移除语音(A)或视觉(V)模态、PMF层或对比学习(CL)均导致性能下降,证实了其有效性。
  • 从训练中移除IEMOCAP与MELD会降低MOSI上的性能,表明跨任务知识迁移具有益处。
  • T-SNE可视化结果证实:正面情感与喜悦情绪的表征,以及原始与生成的情绪标签,位于共享特征空间中,验证了框架在情感与情绪对齐上的有效性。
  • 即使在混合数据集上进行训练,模型性能依然稳健,表明统一框架具备出色的泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。