[论文解读] Visual and Textual Sentiment Analysis Using Deep Fusion Convolutional Neural Networks
该论文提出了一种端到端的深度融合卷积神经网络,通过在池化层融合特征,联合学习视觉和文本的情感表征,显著提升了情感分类的准确率。在VSO数据集上,其准确率达到84.7%,较最先进方法高出1.3个百分点,证明了多模态融合的有效性。
Sentiment analysis is attracting more and more attentions and has become a very hot research topic due to its potential applications in personalized recommendation, opinion mining, etc. Most of the existing methods are based on either textual or visual data and can not achieve satisfactory results, as it is very hard to extract sufficient information from only one single modality data. Inspired by the observation that there exists strong semantic correlation between visual and textual data in social medias, we propose an end-to-end deep fusion convolutional neural network to jointly learn textual and visual sentiment representations from training examples. The two modality information are fused together in a pooling layer and fed into fully-connected layers to predict the sentiment polarity. We evaluate the proposed approach on two widely used data sets. Results show that our method achieves promising result compared with the state-of-the-art methods which clearly demonstrate its competency.
研究动机与目标
- 通过利用社交媒体中视觉和文本模态的互补信息,解决单模态情感分析的局限性。
- 通过深度层次化特征学习,弥合低层次图像特征与高层次情感语义之间的情感鸿沟。
- 通过建模多模态数据中图像与短文本之间的语义相关性,提升情感预测性能。
- 构建一种端到端框架,在后期阶段融合视觉与文本表征,以保留全局图像上下文的同时捕捉局部文本特征。
- 在基准数据集上证明深度融合相较于早期/晚期融合以及模态特定基线方法的优越性。
提出的方法
- 使用预训练的Word2Vec(200维)将文本描述嵌入为分布式向量表示,OOV词随机初始化。
- 应用多层CNN,卷积核大小分别为3、4和5,从嵌入的文本序列中提取局部n-gram特征。
- 通过与AlexNet前五层相同的五层卷积架构处理输入图像,输入图像尺寸调整为224×224。
- 通过在池化层连接池化后的视觉与文本特征表示,再输入全连接层,实现视觉与文本特征的融合。
- 采用晚期融合策略,使各模态的特征独立学习,并在表征层面进行融合,以保留全局图像上下文。
- 使用批量大小为100的mini-batch进行端到端模型训练,初始初始学习率为0.0001,每3000步以0.96的基数指数衰减。
实验结果
研究问题
- RQ1联合学习视觉与文本特征是否能超越单模态方法,提升情感分类性能?
- RQ2在多模态情感分析中,深度视觉与文本表征的晚期融合与早期或晚期融合策略相比表现如何?
- RQ3在结合局部文本特征时,保留全局图像上下文在多大程度上能增强情感预测?
- RQ4所提出的深度融合模型是否在VSO和MVSO-EN等基准数据集上优于现有最先进方法?
- RQ5该模型在真实社交媒体数据集中面对噪声大、弱标签数据时的鲁棒性如何?
主要发现
- 所提出的深度融合模型在VSO数据集上达到84.7%的准确率,较之前最先进方法高出1.3个百分点。
- 在VSO数据集上,该模型显著优于单模态基线方法(ST:69.5%准确率,SV:63.1%准确率),证明了多模态融合的价值。
- 该模型优于PCNN(78.1%准确率)、You的CCR方法(67.2%准确率)和T-LSTM(83.3%准确率),在VSO数据集上表现最佳。
- 在噪声更大的MVSO-EN数据集上,该模型达到73.7%的准确率,表明其在数据噪声增加时仍具鲁棒性。
- 性能提升归因于全局图像特征与局部文本特征的有效融合,从而实现了更优的语义表征学习。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。