[论文解读] Sentiment Analysis on IMDB Movie Comments and Twitter Data by Machine Learning and Vector Space Techniques
本研究基于IMDB电影评论(2,000个样本)和Twitter数据(3,200个样本),利用KNIME Analytics平台,采用机器学习与向量空间技术提出了一种情感分析模型。该研究评估了决策树、朴素贝叶斯和SVM分类器,发现在IMDB数据上SVM的准确率最高,达到85.50%,在Twitter数据上达到72.50%,在两个数据集上均优于其他算法。
This study's goal is to create a model of sentiment analysis on a 2000 rows IMDB movie comments and 3200 Twitter data by using machine learning and vector space techniques; positive or negative preliminary information about the text is to provide. In the study, a vector space was created in the KNIME Analytics platform, and a classification study was performed on this vector space by Decision Trees, Naïve Bayes and Support Vector Machines classification algorithms. The conclusions obtained were compared in terms of each algorithms. The classification results for IMDB movie comments are obtained as 94,00%, 73,20%, and 85,50% by Decision Tree, Naive Bayes and SVM algorithms. The classification results for Twitter data set are presented as 82,76%, 75,44% and 72,50% by Decision Tree, Naive Bayes SVM algorithms as well. It is seen that the best classification results presented in both data sets are which calculated by SVM algorithm.
研究动机与目标
- 开发一种基于机器学习与向量空间技术的电影评论与社交媒体文本情感分类模型。
- 比较决策树、朴素贝叶斯与支持向量机在情感分类任务中的性能表现。
- 评估模型在两个不同文本数据集(IMDB电影评论与Twitter数据)上的有效性。
- 识别在给定情境下情感分析的最优算法与向量表示策略。
- 对真实世界文本数据中不同机器学习模型的分类准确率进行对比分析。
提出的方法
- 使用IMDB电影评论与Twitter的文本数据,在KNIME Analytics平台中构建了向量空间表示。
- 文本预处理包括分词与特征提取,将原始文本转换为可用于分类的数值向量。
- 在向量化数据上训练并评估了三种分类器:决策树、朴素贝叶斯与支持向量机。
- 通过分类准确率衡量模型性能,并在不同算法与数据集之间进行比较。
- 本研究采用固定的数据集规模:IMDB评论2,000条,Twitter样本3,200条,以确保评估的一致性。
- 所有实验均在KNIME Analytics平台内完成,充分利用其集成的机器学习与数据预处理工具。
实验结果
研究问题
- RQ1在IMDB电影评论数据上,哪种机器学习算法能实现最高的情感分类准确率?
- RQ2决策树、朴素贝叶斯与SVM在Twitter情感分析任务中的表现如何?
- RQ3SVM算法是否在IMDB与Twitter两个数据集上均持续优于其他分类器?
- RQ4向量空间表示在此设置下对情感分类性能有何影响?
- RQ5在结构化电影评论与非正式社交媒体文本之间,结果有何差异?
主要发现
- SVM分类器在IMDB电影评论数据集上实现了85.50%的最高准确率,优于决策树(94.00%)与朴素贝叶斯(73.20%)。
- 在Twitter数据集上,SVM达到72.50%的准确率,仅次于决策树(82.76%),但高于朴素贝叶斯(75.44%)。
- 尽管总体准确率较低,朴素贝叶斯在两个数据集上均表现出一致的性能,表明其对数据分布差异具有较强的鲁棒性。
- 决策树在Twitter数据上取得了最高的准确率(82.76%),表明其适用于具有高词汇可变性的短文本与非正式文本。
- 结果表明,SVM在IMDB数据上的情感分析中最为有效,而决策树在Twitter数据上表现最佳。
- 总体而言,SVM在两个数据集上均展现出最均衡且最高的性能,尤其在更正式的IMDB评论中表现突出。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。