Skip to main content
QUICK REVIEW

[论文解读] Cross-Modality Gated Attention Fusion for Multimodal Sentiment Analysis

Ming Jiang, Shaoxiong Ji|arXiv (Cornell University)|Aug 25, 2022
Sentiment Analysis and Opinion Mining被引用 4
一句话总结

该论文提出CMGA,一种用于多模态情感分析的跨模态门控注意力融合模型,通过模态对之间的交叉注意力机制以及遗忘门来过滤噪声信号。该方法在MOSI和MOSEI数据集上实现了最先进性能,通过增强跨模态交互同时保留独特的模态特定特征。

ABSTRACT

Multimodal sentiment analysis is an important research task to predict the sentiment score based on the different modality data from a specific opinion video. Many previous pieces of research have proved the significance of utilizing the shared and unique information across different modalities. However, the high-order combined signals from multimodal data would also help extract satisfied representations. In this paper, we propose CMGA, a Cross-Modality Gated Attention fusion model for MSA that tends to make adequate interaction across different modality pairs. CMGA also adds a forget gate to filter the noisy and redundant signals introduced in the interaction procedure. We experiment on two benchmark datasets in MSA, MOSI, and MOSEI, illustrating the performance of CMGA over several baseline models. We also conduct the ablation study to demonstrate the function of different components inside CMGA.

研究动机与目标

  • 解决情感分析中多模态交互引入的噪声和冗余信号问题。
  • 通过显式建模所有模态对(文本-视频、视频-音频、文本-音频)之间的交互,增强跨模态特征融合。
  • 在有效整合模态间共享信号的同时,保留独特的模态特定表示。
  • 通过遗忘门机制过滤无关或冗余的注意力特征,提升情感预测性能。
  • 通过消融研究验证各组件设计的有效性,包括模态重要性与架构模块。

提出的方法

  • 模型使用预训练BERT处理文本,使用Bi-LSTM配合全连接层处理视觉和音频特征,所有模态特征投影到共享维度 $ d_k $。
  • 对三对模态(文本-视频、视频-音频、文本-音频)应用跨模态注意力,使用来自配对模态的查询、键和值矩阵。
  • 对每对模态,注意力机制计算加权交互,其中一个模态作为查询,另一个作为键/值,实现跨模态对齐。
  • 在跨注意力输出上应用遗忘门,以抑制噪声或冗余特征,提升融合表示中的信噪比。
  • 使用残差连接以保留原始模态特征,并防止训练过程中的性能退化。
  • 基于Transformer的融合层聚合经过优化的跨注意力特征,以预测最终情感得分。

实验结果

研究问题

  • RQ1与现有多模态融合方法相比,所提出的CMGA模型在情感预测准确率方面有何提升?
  • RQ2遗忘门机制在过滤跨模态注意力过程中的冗余或噪声信号方面起到了什么作用?
  • RQ3不同模态交互顺序(如(文本,视频)与(视频,文本))如何影响模型性能?
  • RQ4各模态(文本、视频、音频)对最终预测的独立贡献是什么?移除它们对性能有何影响?
  • RQ5如跨注意力和残差连接等架构组件如何影响模型的有效性?

主要发现

  • 在MOSI数据集上,CMGA实现MAE为0.790,Acc-7为43.29,优于大多数基线模型的评估指标。
  • 在MOSEI数据集上,CMGA实现MAE为0.545,Acc-7为53.03,展现出在不同数据集上的强泛化能力。
  • 消融研究显示,移除遗忘门后,MOSI上的MAE上升至0.856,MOSEI上的MAE上升至0.594,证实其在噪声抑制中的关键作用。
  • 移除跨注意力机制导致性能显著下降,MOSI上的MAE升至0.845,MOSEI上的MAE升至0.587,表明其在跨模态学习中的重要性。
  • 消融研究揭示,文本模态对性能贡献最大,因为移除它会导致准确率最大降幅(MOSI上降至30.51%)。
  • 反转模态对顺序的实验表明,文本到视频的注意力比视频到音频更重要,因为当将(文本,视频)对反转为(视频,文本)时,MOSI上的MAE从0.790升至0.814,性能下降更明显。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。