Skip to main content
QUICK REVIEW

[论文解读] Multimodal Sentiment Analysis using Hierarchical Fusion with Context Modeling

Navonil Majumder, Devamanyu Hazarika|arXiv (Cornell University)|Jun 16, 2018
Sentiment Analysis and Opinion Mining被引用 13
一句话总结

该论文提出了一种用于多模态情感分析的分层融合框架,首先通过全连接层将单模态特征融合为双模态表示,再通过GRU进行上下文建模,将双模态表示进一步融合为三模态表示。该方法在CMU-MOSI和IEMOCAP数据集上相比最先进技术实现了1–2.4%的准确率提升,且在话语级情感分析中误差率最高降低10%。

ABSTRACT

Multimodal sentiment analysis is a very actively growing field of research. A promising area of opportunity in this field is to improve the multimodal fusion mechanism. We present a novel feature fusion strategy that proceeds in a hierarchical fashion, first fusing the modalities two in two and only then fusing all three modalities. On multimodal sentiment analysis of individual utterances, our strategy outperforms conventional concatenation of features by 1%, which amounts to 5% reduction in error rate. On utterance-level multimodal sentiment analysis of multi-utterance video clips, for which current state-of-the-art techniques incorporate contextual information from other utterances of the same clip, our hierarchical fusion gives up to 2.4% (almost 10% error rate reduction) over currently used concatenation. The implementation of our method is publicly available in the form of open-source code.

研究动机与目标

  • 为解决简单特征拼接在多模态情感分析中的局限性,后者无法有效处理模态间冲突信号。
  • 通过分层结构化融合过程,先成对融合模态,再合并全部三种模态,以改进多模态融合。
  • 利用GRU建模话语级上下文,提升在序列视频片段中的表征学习能力。
  • 在多模态情感与情绪分类任务中超越现有最先进方法。

提出的方法

  • 首先使用专用编码器为每个话语提取单模态特征(文本、语音、视频)。
  • 通过全连接层执行双模态特征融合,生成上下文感知的双模态表示。
  • 通过应用于双模态融合特征的GRU,对话语之间的上下文信息进行建模。
  • 通过另一层全连接层将三个双模态表示融合为三模态表示,并再使用一个GRU传播上下文信息。
  • 最终融合表示通过Softmax层用于情感分类。
  • 模型采用交叉熵损失进行端到端训练,实现代码已在GitHub公开。

实验结果

研究问题

  • RQ1与简单拼接相比,先成对融合模态再进行完整融合的分层融合策略是否能提升多模态情感分类的准确率?
  • RQ2通过GRU引入话语级上下文信息,对视频片段中的多模态情感分析性能有何影响?
  • RQ3所提方法是否在单模态与多模态情感分类任务中均优于最先进模型?
  • RQ4当文本与语音或视觉线索冲突时,该模型如何处理模态间的冲突信号?
  • RQ5与现有融合技术相比,该分层融合机制在多大程度上降低了错误率?

主要发现

  • 所提出的分层融合(HFusion)方法在单话语情感分析中相比简单拼接实现1%的准确率提升,对应误差率降低5%。
  • 在多话语视频片段中,HFusion相比基线拼接方法准确率最高提升2.4%,误差率降低近10%。
  • 在CMU-MOSI数据集中,HFusion在所有模态组合下相比最先进方法提升1–2%,其中多模态设置下增益最高。
  • 在IEMOCAP数据集中,HFusion相比最先进方法实现1–2.4%的准确率提升,三模态性能比仅使用文本的模型高3%。
  • 引入上下文建模的模型(CHFusion)在所有模态组合下相比HFusion提升1–2%,证实了序列上下文整合的优势。
  • 在IEMOCAP上的类别级分析显示F1分数一致提升(如:Happy类为81.4%,Anger类为77.6%),表明在各类情绪中均表现稳健。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。