Skip to main content
QUICK REVIEW

[论文解读] ScaleVLAD: Improving Multimodal Sentiment Analysis via Multi-Scale Fusion of Locally Descriptors

Huaishao Luo, Lei Ji|arXiv (Cornell University)|Dec 2, 2021
Sentiment Analysis and Opinion Mining参考文献 48被引用 8
一句话总结

该论文提出ScaleVLAD,一种用于多模态情感分析的多尺度融合方法,通过共享的局部聚合描述符(VLAD)向量,在不同语义粒度下对齐文本、视频和音频特征。通过采用可学习的潜在语义向量和自监督偏移聚类损失,ScaleVLAD提升了特征区分能力,并在IEMOCAP、MOSI和MOSEI基准上实现了最先进性能。

ABSTRACT

Fusion technique is a key research topic in multimodal sentiment analysis. The recent attention-based fusion demonstrates advances over simple operation-based fusion. However, these fusion works adopt single-scale, i.e., token-level or utterance-level, unimodal representation. Such single-scale fusion is suboptimal because that different modality should be aligned with different granularities. This paper proposes a fusion model named ScaleVLAD to gather multi-Scale representation from text, video, and audio with shared Vectors of Locally Aggregated Descriptors to improve unaligned multimodal sentiment analysis. These shared vectors can be regarded as shared topics to align different modalities. In addition, we propose a self-supervised shifted clustering loss to keep the fused feature differentiation among samples. The backbones are three Transformer encoders corresponding to three modalities, and the aggregated features generated from the fusion module are feed to a Transformer plus a full connection to finish task predictions. Experiments on three popular sentiment analysis benchmarks, IEMOCAP, MOSI, and MOSEI, demonstrate significant gains over baselines.

研究动机与目标

  • 为解决多模态情感分析中单尺度融合的局限性,即仅在词元级或话语级对单模态表征进行对齐。
  • 减少在时间与语义粒度不同的模态之间存在的语义错位,特别是在非语言信号(如音频、视频)缺乏清晰语义边界的情况下。
  • 通过新颖的自监督损失利用标签信息,提升融合表征空间中的特征判别能力。
  • 通过跨文本、视频和音频模态共享的可学习潜在语义向量,实现灵活的多尺度单模态特征对齐。
  • 通过联合优化特征融合与聚类,实现在标准多模态情感分析基准上的最先进性能。

提出的方法

  • ScaleVLAD使用三个模态专用的Transformer编码器,从文本、视频和音频中提取单模态表征。
  • 采用多尺度滑动窗口机制,为每种模态提取不同粒度的局部特征(例如,1、2、3、10个词元/窗口)。
  • 通过可学习的码书将局部特征聚合为共享的局部聚合描述符(VLAD)向量,其中共享向量在不同模态间充当共享语义主题。
  • 模型使用自监督偏移聚类损失(S3C),通过保持动量更新的聚类中心,增强样本间特征的区分度。
  • 将ScaleVLAD的融合特征输入Transformer编码器和前馈网络,进行最终的情感预测。
  • 整个模型通过分类任务的交叉熵损失和表示学习的S3C损失进行端到端联合训练。

实验结果

研究问题

  • RQ1通过在不同语义粒度下对齐特征,多尺度局部描述符融合是否能提升多模态情感分析性能?
  • RQ2共享的、可学习的潜在语义向量是否能有效弥合在时间与语义分辨率不同的文本、视频和音频模态之间的语义鸿沟?
  • RQ3自监督偏移聚类损失是否能在无需显式监督的情况下提升融合多模态表征的判别能力?
  • RQ4在多样化的多模态情感分析基准上,ScaleVLAD与最先进方法相比性能如何?
  • RQ5在未对齐的多模态设置中,多尺度融合与S3C损失在性能提升中的贡献程度如何?

主要发现

  • ScaleVLAD在所有三个基准上均取得新的最先进结果:IEMOCAP、CMU-MOSI和CMU-MOSEI。
  • 在IEMOCAP上,ScaleVLAD达到84.5%的准确率和86.4%的F1分数,优于先前的最先进方法如MISA和Self-MM。
  • 在CMU-MOSEI上,ScaleVLAD达到84.7%的F1分数和0.781的相关系数,优于TFN、MulT和ICCN等模型。
  • 消融实验表明,多尺度融合与S3C损失均不可或缺,当任一组件被移除时,F1分数下降1.4–1.5%。
  • t-SNE可视化结果表明,S3C损失使嵌入空间中的聚类更紧密、更易分离,尤其在情感分数相近的样本中表现更优。
  • 该模型能动态学习模态间的对齐模式,共享向量有效捕捉了多词元短语(如'really really loved')以及更长时长的音频/视频片段。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。