Skip to main content
QUICK REVIEW

[论文解读] Multimodal Emotion-Cause Pair Extraction in Conversations

Fanfan Wang, Zixiang Ding|arXiv (Cornell University)|Oct 15, 2021
Sentiment Analysis and Opinion Mining参考文献 42被引用 5
一句话总结

本文提出了对话中的多模态情感-原因对抽取(MC-ECPE)这一新任务,联合从多模态对话数据(文本、音频、视频)中抽取情感-原因对。作者基于情景喜剧《老友记》构建了情感-原因在《老友记》(ECF)数据集,包含13,509句对话中的9,272对标注,建立了融合多模态特征的基线系统,结果表明声学和视觉模态显著提升了F1分数,尤其在未在文本中明确表达的原因的召回率方面表现突出。

ABSTRACT

Emotion cause analysis has received considerable attention in recent years. Previous studies primarily focused on emotion cause extraction from texts in news articles or microblogs. It is also interesting to discover emotions and their causes in conversations. As conversation in its natural form is multimodal, a large number of studies have been carried out on multimodal emotion recognition in conversations, but there is still a lack of work on multimodal emotion cause analysis. In this work, we introduce a new task named Multimodal Emotion-Cause Pair Extraction in Conversations, aiming to jointly extract emotions and their associated causes from conversations reflected in multiple modalities (text, audio and video). We accordingly construct a multimodal conversational emotion cause dataset, Emotion-Cause-in-Friends, which contains 9,272 multimodal emotion-cause pairs annotated on 13,509 utterances in the sitcom Friends. We finally benchmark the task by establishing a baseline system that incorporates multimodal features for emotion-cause pair extraction. Preliminary experimental results demonstrate the potential of multimodal information fusion for discovering both emotions and causes in conversations.

研究动机与目标

  • 提出一项新任务——对话中的多模态情感-原因对抽取(MC-ECPE),联合从多模态对话数据中抽取情感及其原因。
  • 解决现有研究主要聚焦于单模态文本的情感-原因分析,尤其在自然、多模态对话中的研究空白。
  • 构建一个大规模、人工标注的数据集——情感-原因在《老友记》(ECF),包含来自情景喜剧《老友记》的13,509句对话中的9,272对情感-原因对,涵盖文本、音频和视频模态。
  • 通过开发一个融合多模态特征的基线系统,对MC-ECPE任务进行基准测试,以提升情感和原因的抽取性能。

提出的方法

  • 所提出的基线系统MC-ECPE-2steps首先使用多模态输入表示的序列标注方法,分别识别情感和原因的语句。
  • 通过预训练模型提取多模态特征:使用BERT提取文本特征,使用Wav2Vec2提取音频特征,使用ViTPose提取视频特征,随后将这些特征拼接形成联合表示。
  • 系统采用相对位置编码来建模语句之间的时序和序列关系,提升情感与原因对之间的对齐效果。
  • 采用两步流水线:首先独立预测情感和原因语句;其次,通过分类头对候选对进行打分和筛选。
  • 模型利用注意力机制,在表示学习过程中动态加权不同模态的重要性。
  • 系统在ECF数据集上进行端到端微调,损失函数针对情感和原因预测任务进行优化。

实验结果

研究问题

  • RQ1与单模态方法相比,多模态融合(文本、音频、视频)在对话场景中提升情感-原因对抽取效果的效率如何?
  • RQ2声学和视觉模态在识别未在文本中明确表达的原因方面,贡献程度如何?
  • RQ3多模态特征的引入如何影响情感-原因对抽取的召回率和精确率,特别是对隐含或依赖语境的原因?
  • RQ4情感类别不平衡如何影响MC-ECPE模型的性能?多模态特征能否缓解此问题?
  • RQ5一个集成了多模态特征的基线系统是否能超越单模态或统计基线,在MC-ECPE任务中表现更优?

主要发现

  • 融合多模态特征的基线系统(MC-ECPE-2steps)显著优于统计基线,表明仅使用相对位置编码不足以实现准确的情感-原因对抽取。
  • 移除声学特征后F1分数下降,表明语音语调和语用特征在识别情感触发因素中起关键作用。
  • 移除视觉特征后F1分数同样下降,表明面部表情和场景上下文等视觉线索对检测隐含原因至关重要。
  • 同时移除音频和视觉特征导致F1分数下降1.9%,凸显多模态信息在揭示文本未明确表达原因方面的互补价值。
  • 模型在情感类别“惊讶”上表现最佳,在“恐惧”上表现最差,反映出类别不平衡带来的挑战,以及识别细微或强烈情感状态的难度。
  • 视觉特征的贡献略低于声学特征,表明当前多模态表示学习在对话场景下的视觉场景理解仍面临重大挑战。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。