Skip to main content
QUICK REVIEW

[论文解读] Multi-modal Sentiment Analysis using Deep Canonical Correlation Analysis

Zhongkai Sun, Prathusha K Sarma|arXiv (Cornell University)|Jul 15, 2019
Sentiment Analysis and Opinion Mining参考文献 18被引用 10
一句话总结

本文提出了一种基于深度典型相关分析(DCCA)的多模态情感分析框架,通过联合嵌入文本、音频和视频特征以提升情感分类性能。通过利用 BERT 进行高质量的文本编码,并应用单步和双步 DCCA 方法学习相关表示,该方法在 CMU-MOSI、CMU-MOSEI 和一个新的辩论情感数据集上实现了最先进(SOTA)的性能,其中文本由于 BERT 的优越特征学习能力而贡献最大。

ABSTRACT

This paper learns multi-modal embeddings from text, audio, and video views/modes of data in order to improve upon down-stream sentiment classification. The experimental framework also allows investigation of the relative contributions of the individual views in the final multi-modal embedding. Individual features derived from the three views are combined into a multi-modal embedding using Deep Canonical Correlation Analysis (DCCA) in two ways i) One-Step DCCA and ii) Two-Step DCCA. This paper learns text embeddings using BERT, the current state-of-the-art in text encoders. We posit that this highly optimized algorithm dominates over the contribution of other views, though each view does contribute to the final result. Classification tasks are carried out on two benchmark datasets and on a new Debate Emotion data set, and together these demonstrate that the one-Step DCCA outperforms the current state-of-the-art in learning multi-modal embeddings.

研究动机与目标

  • 通过使用深度典型相关分析联合学习文本、音频和视频的表示,以提升多模态情感分类性能。
  • 探究各模态(文本、音频、视频)对最终情感分类性能的相对贡献。
  • 评估单步和双步 DCCA 框架在融合多模态特征用于情感分析方面的有效性。
  • 证明预训练 BERT 作为固定编码器用于文本而无需微调在多模态学习中的有效性。
  • 引入并评估一个新的辩论情感数据集,同时在基准数据集上进行多模态情感分析评估。

提出的方法

  • 采用深度典型相关分析(DCCA)学习文本、音频和视频模态之间的非线性相关表示。
  • 使用 BERT 作为固定编码器提取文本的高维上下文感知嵌入,无需微调。
  • 通过先学习音频与视频之间的相关性,再将结果与文本嵌入结合,应用双步 DCCA 方法。
  • 使用单步 DCCA 在单次优化步骤中同时学习所有三个模态之间的相关表示。
  • 采用 BiLSTM、3D-CNN 和 openSMILE 进行音频与视频特征提取,同时 BERT 提供文本特征。
  • 通过 DCCA 融合模态,以最大化不同视图之间的典型相关性,从而过滤掉不相关的噪声。

实验结果

研究问题

  • RQ1与单模态方法相比,融合文本、音频和视频模态在情感分类准确率方面有何提升?
  • RQ2各模态(文本、音频、视频)对最终多模态情感分类性能的相对贡献是什么?
  • RQ3双步 DCCA 方法(按顺序处理模态)是否优于单步 DCCA 方法(同时融合所有模态)?
  • RQ4将预训练 BERT 作为固定文本编码器在多模态情感分析中能多大程度上提升性能?
  • RQ5所提出的基于 DCCA 的融合方法在基准数据集和新数据集上与现有最先进基线方法相比表现如何?

主要发现

  • 单步 DCCA 方法在 CMU-MOSI、CMU-MOSEI 和辩论情感数据集上均优于现有最先进方法,在 MOSI 数据集上达到 92.05% 的准确率,在 MOSEI 数据集上达到 91.34%。
  • 在 DCCA 框架中同时使用三种模态(文本、音频、视频)可获得最高分类准确率,证实了多模态融合的优势。
  • 双步 DCCA 方法(先关联音频与视频,再与文本结合)的性能与单步 DCCA 方法相当,在 MOSEI 数据集上达到 91.34% 的准确率,在辩论情感数据集上达到 83.33% 的 F1 分数。
  • BERT 提取的文本嵌入主导了最终表示,这从文本加入后性能持续提升中得到证实,尽管音频和视频也作出了有意义的贡献。
  • 文本与其他模态之间的性能差距可能源于 BERT 在大规模文本数据上的优越优化,表明音频和视频的特征提取方法可能尚未充分发展。
  • 研究表明,融合策略的选择(单步 vs. 双步)和模态顺序对性能有显著影响,先关联音频与视频再整合文本的策略表现最佳。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。