[论文解读] A Study of Feature Extraction techniques for Sentiment Analysis
本研究在五个基准数据集上使用多种分类器,评估了TF-IDF与Doc2Vec在情感分析中的表现。在大多数数据集中,Doc2Vec表现优于TF-IDF,尤其在小型、领域特定的评论中表现更优,其中逻辑回归与SVM-RBF分类器准确率最高,表明分布式句子表征相较于传统的词频方法能更有效地提升情感分类性能。
Sentiment Analysis refers to the study of systematically extracting the meaning of subjective text . When analysing sentiments from the subjective text using Machine Learning techniques,feature extraction becomes a significant part. We perform a study on the performance of feature extraction techniques TF-IDF(Term Frequency-Inverse Document Frequency) and Doc2vec (Document to Vector) using Cornell movie review datasets, UCI sentiment labeled datasets, stanford movie review datasets,effectively classifying the text into positive and negative polarities by using various pre-processing methods like eliminating StopWords and Tokenization which increases the performance of sentiment analysis in terms of accuracy and time taken by the classifier.The features obtained after applying feature extraction techniques on the text sentences are trained and tested using the classifiers Logistic Regression,Support Vector Machines,K-Nearest Neighbours , Decision Tree and Bernoulli Nave Bayes
研究动机与目标
- 评估TF-IDF与Doc2Vec作为特征提取技术在情感分析中的有效性。
- 评估停用词去除与分词等预处理步骤对分类准确率的影响。
- 比较多种分类器(逻辑回归、SVM、KNN、决策树与伯努利朴素贝叶斯)在与不同特征提取方法搭配时的性能表现。
- 确定在不同规模的情感数据集中,哪种特征提取技术能获得更高的准确率。
- 为实际情感分类任务中TF-IDF与Doc2Vec的适用性提供实证洞察。
提出的方法
- 采用TF-IDF方法,超参数包括:max_df、use_idf、sublinear_tf及停用词过滤。
- 使用Doc2Vec并调优超参数:min_count、窗口大小、向量维度、负采样、工作线程数、dm(0表示CBOW,1表示Skip-gram)及训练轮数。
- 在特征提取前通过分词与停用词去除对文本进行预处理。
- 在五个基准数据集上训练并测试分类器:康奈尔电影评论数据集、UCI情感标注数据集、斯坦福电影评论数据集,以及来自斯坦福和康奈尔的更大规模数据集。
- 以准确率为首要评估指标,基于真正例、假正例等的2×2列联表计算得出。
- 在不同规模的数据集上进行对比分析,以评估各方法的可扩展性与鲁棒性。
实验结果
研究问题
- RQ1在多样化的情感数据集中,TF-IDF与Doc2Vec在分类准确率方面如何比较?
- RQ2哪种预处理与特征提取组合能获得最高的情感分类准确率?
- RQ3在不同数据集规模下,使用TF-IDF与Doc2Vec时,哪种分类器表现最佳?
- RQ4Doc2Vec是否在低资源或领域特定设置中始终优于TF-IDF?
- RQ5TF-IDF与Doc2Vec的超参数设置如何影响最终的情感预测性能?
主要发现
- 在五个数据集中的四个中,Doc2Vec的准确率高于TF-IDF,尤其在小型、领域特定的数据集(如数据集-4)中表现突出,使用逻辑回归时准确率达99.98%。
- 在数据集-1(1,500条评论)中,Doc2Vec在所有分类器上均优于TF-IDF,SVM-RBF达到86.86%准确率,而TF-IDF仅为75.14%。
- 在数据集-5(大规模电影评论数据集)中,TF-IDF略胜于Doc2Vec,逻辑回归准确率达88.46%,而Doc2Vec为86.49%。
- 逻辑回归与使用RBF及线性核的SVM在两种特征提取技术下均持续取得最高准确率,表明其在情感分类任务中具有更强的鲁棒性。
- 在数据集-2(2,000条评论)中,TF-IDF优于Doc2Vec,SVM-RBF准确率达82.35%,而Doc2Vec仅为77.40%。
- 不同方法之间的性能差距因数据集规模与领域而异,表明Doc2Vec在细粒度或上下文敏感的情感分析中更具优势,而TF-IDF在大规模通用数据集上仍具竞争力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。