[论文解读] Deep Learning for Digital Text Analytics: Sentiment Analysis
本文提出了一种用于数字新闻文本情感分析的深度学习方法,结合VADER进行初始标注,并使用带有预训练GloVe词向量的卷积神经网络(CNN)将新闻分类为正面或负面。该模型在内部和外部数据集上均实现了96%的训练准确率和超过85%的测试准确率,优于SVM和Doc2Vec等传统方法。
In today's scenario, imagining a world without negativity is something very unrealistic, as bad NEWS spreads more virally than good ones. Though it seems impractical in real life, this could be implemented by building a system using Machine Learning and Natural Language Processing techniques in identifying the news datum with negative shade and filter them by taking only the news with positive shade (good news) to the end user. In this work, around two lakhs datum have been trained and tested using a combination of rule-based and data driven approaches. VADER along with a filtration method has been used as an annotating tool followed by statistical Machine Learning approach that have used Document Term Matrix (representation) and Support Vector Machine (classification). Deep Learning algorithms then came into picture to make this system reliable (Doc2Vec) which finally ended up with Convolutional Neural Network(CNN) that yielded better results than the other experimented modules. It showed up a training accuracy of 96%, while a test accuracy of (internal and external news datum) above 85% was obtained.
研究动机与目标
- 开发一个可靠的系统,通过自然语言处理与机器学习技术,过滤负面新闻并仅向最终用户提供正面新闻。
- 通过结合基于规则的情感分析(VADER)与机器学习模型,减少人工标注的工作量。
- 在传统统计方法(如DTM-SVM)和神经网络方法(如Doc2Vec)的基础上,进一步提升情感分类的准确率。
- 评估深度学习模型(尤其是CNN)在具有不同领域特征的真实新闻文本上的表现。
- 通过使用预训练词向量(GloVe)和超参数调优,提升模型在内部和外部测试数据上的泛化能力。
提出的方法
- 使用VADER结合过滤方法,自动为约20万个新闻样本标注情感极性(正面/负面)。
- 采用基于文档词项矩阵(DTM)表示和支持向量机(SVM)的统计机器学习流程作为基线分类方法。
- 采用Doc2Vec对整个文档进行分布式表示,以捕捉超越词袋模型的语义上下文信息。
- 设计一个卷积神经网络(CNN),包含600个滤波器、滤波器大小为3、使用ReLU激活函数、最大池化操作,并采用0.5的dropout正则化。
- 集成预训练的GloVe词向量,以改善输入表示并增强模型泛化能力。
- 优化超参数,包括初始学习率、训练轮数(20轮)、步长(1)和填充方式(有效填充),并在GPU上进行训练以提高效率。
实验结果
研究问题
- RQ1结合基于规则的情感评分(VADER)与深度学习的混合方法,是否能提升新闻文本情感分类的准确率?
- RQ2基于CNN的模型在新闻文章情感分类中,相较于传统方法(如DTM-SVM和Doc2Vec)表现如何?
- RQ3使用预训练的GloVe词向量在多大程度上提升了情感分类模型在新闻数据上的性能?
- RQ4该模型是否能很好地泛化到训练过程中未使用过的外部新闻数据?
- RQ5超参数调优与dropout正则化对模型鲁棒性和测试准确率有何影响?
主要发现
- CNN模型实现了96%的训练准确率,表明其在训练数据上具有强大的学习能力。
- 在与训练集分布相同的未见数据上,内部测试准确率超过85%。
- 在人工标注的外部新闻数据上,外部测试准确率也超过85%,表明模型对现实世界新闻具有稳健的泛化能力。
- CNN优于DTM-SVM和Doc2Vec基线模型,证实其在该文本分类任务中的优越性。
- 预训练GloVe词向量的集成显著改善了输入表示和模型性能。
- 超参数调优(包括0.5的dropout和最优滤波器大小3)有助于提升泛化能力并减少过拟合。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。