[论文解读] Select-Additive Learning: Improving Generalization in Multimodal Sentiment Analysis
本文提出选择性加法学习(SAL),一种两阶段方法,通过识别并减少神经网络表征中对混淆因素(如佩戴眼镜等说话人特异性特征)的依赖,提升多模态情感分析的泛化能力。SAL 在所有模态(文本、语音、视觉)及其融合中均提升了最先进模型的性能,显著提高了准确率,尤其在跨数据集评估中表现突出,p 值 < 0.005 表明结果具有统计显著性。
Multimodal sentiment analysis is drawing an increasing amount of attention these days. It enables mining of opinions in video reviews which are now available aplenty on online platforms. However, multimodal sentiment analysis has only a few high-quality data sets annotated for training machine learning algorithms. These limited resources restrict the generalizability of models, where, for example, the unique characteristics of a few speakers (e.g., wearing glasses) may become a confounding factor for the sentiment classification task. In this paper, we propose a Select-Additive Learning (SAL) procedure that improves the generalizability of trained neural networks for multimodal sentiment analysis. In our experiments, we show that our SAL approach improves prediction accuracy significantly in all three modalities (verbal, acoustic, visual), as well as in their fusion. Our results show that SAL, even when trained on one dataset, achieves good generalization across two new test datasets.
研究动机与目标
- 解决由于数据集规模小、资源有限,导致多模态情感分析模型泛化能力差的问题。
- 识别并缓解在小数据集中与情感相关但与说话人身份相关的混淆因素(如佩戴眼镜等说话人特异性视觉特征)。
- 通过减少对身份特异性特征的依赖,提升神经网络在不同个体和数据集上的鲁棒性。
- 证明 SAL 能在不损害情感相关表征质量的前提下提升模型泛化能力。
- 在同数据集和跨数据集设置下验证该方法的有效性,包括真实世界数据集如 MOSI、YouTube 和 MOUD。
提出的方法
- 实施两阶段选择性加法学习(SAL)流程:首先进行选择阶段,从训练好的神经网络的潜在表征中识别混淆因素。
- 在选择阶段,计算基于表征的度量 $ h(Z, \delta) $,以检测潜在空间中与说话人身份强相关而非与情感相关的维度。
- 在加法阶段,向识别出的混淆维度注入高斯噪声,以降低其对最终预测的影响。
- 使用置换检验验证性能提升的统计显著性。
- 端到端训练模型,将噪声注入整合到训练和验证阶段,以增强鲁棒性。
- 通过聚类间距离与聚类内距离比值评估聚类质量,比较 SAL 应用前后基于情感与基于身份的聚类效果。
实验结果
研究问题
- RQ1在小规模多模态数据集中,混淆因素(如说话人身份)在多大程度上对情感分类产生负面影响?
- RQ2是否可以使神经网络减少对身份特异性视觉或语音特征的依赖,同时不降低情感相关表征质量?
- RQ3所提出的 SAL 方法是否能提升模型在不同数据集和未见个体上的泛化能力?
- RQ4SAL 如何影响潜在表征空间中情感与身份聚类结构的关系?
- RQ5SAL 的性能提升在多个数据集和模态上是否具有统计显著性?
主要发现
- SAL 在所有单模态(语言、语音、视觉)及多模态(双模态与全融合)设置中均显著提升预测准确率,同数据集评估中语言模态的 F1 分数最高提升 0.052。
- 在 YouTube 数据集中,SAL 将语言模态准确率从 0.605(CNN)提升至 0.657,语音模态从 0.441 提升至 0.564,表明在低资源设置下具有强大鲁棒性。
- 在跨数据集评估中,SAL 在 YouTube 数据集上的置换检验 p 值为 0.0003,证实其性能显著优于基线 CNN。
- SAL 应用后,基于情感的聚类中,聚类间距离与聚类内距离的比值分别提升 44%(语言)、72%(视觉)和 15%(语音),表明情感表征清晰度显著增强。
- SAL 维持或略微提升基于身份的聚类质量(语言模态提升 9%,视觉模态提升 13%),表明其在降低混淆影响的同时未破坏说话人身份表征。
- 该方法在三个测试数据集(MOSI、YouTube、MOUD)上均实现一致的性能提升,其中语音和视觉模态的改进最为显著,表明其具有广泛适用性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。