[论文解读] Exploiting Deep Learning for Persian Sentiment Analysis
本文提出并评估了深度学习模型——深度自编码器和一维卷积神经网络(1D-CNNs)——在一种新型电影评论数据集上的波斯语情感分析。使用 fastText 词嵌入,并与多层感知机(MLP)进行对比评估,1D-CNN 达到了 82.86% 的最高准确率,表现出优于自编码器和当前最优的 MLP 基线模型的性能。
The rise of social media is enabling people to freely express their opinions about products and services. The aim of sentiment analysis is to automatically determine subject's sentiment (e.g., positive, negative, or neutral) towards a particular aspect such as topic, product, movie, news etc. Deep learning has recently emerged as a powerful machine learning technique to tackle a growing demand of accurate sentiment analysis. However, limited work has been conducted to apply deep learning algorithms to languages other than English, such as Persian. In this work, two deep learning models (deep autoencoders and deep convolutional neural networks (CNNs)) are developed and applied to a novel Persian movie reviews dataset. The proposed deep learning models are analyzed and compared with the state-of-the-art shallow multilayer perceptron (MLP) based machine learning model. Simulation results demonstrate the enhanced performance of deep learning over state-of-the-art MLP.
研究动机与目标
- 为解决自然语言处理中波斯语这一低资源语言缺乏基于深度学习的情感分析模型的问题。
- 开发并评估深度神经网络架构——特别是深度自编码器和 1D-CNN——在波斯语情感分类中的应用。
- 在新收集的波斯语电影评论数据集上,将深度学习模型的性能与当前最优的浅层 MLP 基线分类器进行比较。
- 为未来在波斯语情感分析中使用深度学习技术的研究建立基准。
提出的方法
- 使用 fastText 生成词嵌入,将每个词转换为 300 维向量以表示语义特征。
- 使用标准反向传播训练多层感知机(MLP)100 次迭代,用于情感分类。
- 采用具有三个隐藏层(1500, 512, 1500)的深度自编码器,以无监督方式实现降维和特征学习。
- 设计了一个包含 11 层(4 个卷积层、4 个最大池化层、3 个全连接层)的 1D-CNN 架构,使用大小为 2 的滤波器和 15 个特征图,随后采用 ReLU 和 softmax 激活函数。
- CNN 模型将输入序列处理为连接的词向量,每个卷积层后应用最大池化以降低特征维度。
- 使用精确率、召回率、F1 值和准确率评估性能,最终层使用 softmax 实现多分类。
实验结果
研究问题
- RQ1深度自编码器能否有效学习波斯语文本情感分类的判别性表征?
- RQ21D-CNN 架构是否在分类波斯语电影评论情感方面优于传统的浅层模型(如 MLP)?
- RQ3在波斯语等低资源语言中,深度学习模型的性能与当前最优的浅层分类器相比如何?
- RQ4当与深度神经网络结合时,fastText 生成的词嵌入在波斯语情感分类中能多大程度上提升性能?
主要发现
- 1D-CNN 模型实现了 82.86% 的最高总体准确率,显著优于 MLP(78.49%)和自编码器(80.08%)模型。
- CNN 模型的宏平均 F1 值为 0.83,表明在正样本和负样本情感类别上,精确率与召回率保持良好平衡。
- 自编码器模型在 MLP 基线之上有所提升,平均准确率达到 80.08%,高于 MLP 的 78.49%。
- CNN 模型在负样本情感预测中表现出最佳精确率(90%),正样本情感预测中也具有较高的召回率(89%),表明其在两类预测中均具有鲁棒性。
- 结果证实,具有自动特征学习能力的深度学习模型优于依赖人工特征工程的传统机器学习模型。
- 本研究为波斯语情感分析建立了新基准,1D-CNN 在新引入的波斯语电影评论数据集上表现最为出色。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。