[论文解读] Efficient Feature Selection techniques for Sentiment Analysis
本文评估了基于过滤的特征选择技术——卡方检验与计数差异——与集成方法(Bagging 和随机子空间)结合用于情感分析,采用 TF-IDF 特征。结果表明,这些高效、低参数的方法在准确率、训练时间及 OOV 处理方面优于深度神经网络,尤其在小样本数据集上表现更优。
Sentiment analysis is a domain of study that focuses on identifying and classifying the ideas expressed in the form of text into positive, negative and neutral polarities. Feature selection is a crucial process in machine learning. In this paper, we aim to study the performance of different feature selection techniques for sentiment analysis. Term Frequency Inverse Document Frequency (TF-IDF) is used as the feature extraction technique for creating feature vocabulary. Various Feature Selection (FS) techniques are experimented to select the best set of features from feature vocabulary. The selected features are trained using different machine learning classifiers Logistic Regression (LR), Support Vector Machines (SVM), Decision Tree (DT) and Naive Bayes (NB). Ensemble techniques Bagging and Random Subspace are applied on classifiers to enhance the performance on sentiment analysis. We show that, when the best FS techniques are trained using ensemble methods achieve remarkable results on sentiment analysis. We also compare the performance of FS methods trained using Bagging, Random Subspace with varied neural network architectures. We show that FS techniques trained using ensemble classifiers outperform neural networks requiring significantly less training time and parameters thereby eliminating the need for extensive hyper-parameter tuning.
研究动机与目标
- 评估各种基于过滤的特征选择技术在情感分析中的有效性。
- 研究集成学习方法(Bagging 和随机子空间)如何提升所选特征的性能。
- 将基于特征选择的模型与基准情感数据集上的深度神经网络架构进行性能比较。
- 分析基于特征选择与神经网络在训练时间、模型参数数及 OOV(词汇外)词处理方面的权衡。
- 识别情感分类中特征选择方法、基分类器与集成技术的最佳组合。
提出的方法
- 使用 TF-IDF 进行特征提取,从文本数据中构建高维特征词典。
- 应用基于过滤的特征选择技术:卡方检验、计数差异(CD)与信息增益,以选择相关特征。
- 在所选特征上训练基分类器——逻辑回归(LR)、多项式朴素贝叶斯(MNB)、决策树(DT)与支持向量机(SVM)。
- 应用集成技术:Bagging 与随机子空间,以提升分类器预测的泛化能力并降低方差。
- 与最先进神经网络模型(LSTM、Bi-LSTM、CNN-Rand、CNN-Static 以及 TF-DCNN/T-MCCNN)在标准数据集(MR、Books、DVD、Electronics、Kitchen)上的表现进行比较。
- 通过准确率与 F1 分数在五个基准数据集上进行评估,结果取五次运行的平均值以确保可靠性。
实验结果
研究问题
- RQ1当与集成方法结合时,哪种基于过滤的特征选择技术(卡方检验、CD、信息增益)在情感分析中取得最高准确率?
- RQ2集成技术(Bagging 与随机子空间)如何提升基于所选特征训练的机器学习分类器的性能?
- RQ3基于特征选择的模型能否在准确率、训练时间与参数效率方面优于深度神经网络架构?
- RQ4与依赖预训练词嵌入的神经网络相比,特征选择模型如何处理词汇外(OOV)词?
- RQ5在使用特征选择与集成方法 vs. 深度学习模型时,模型复杂度(参数数)与性能之间的权衡是什么?
主要发现
- 卡方检验与计数差异特征选择技术在所有数据集上均取得最高准确率,优于信息增益及其他过滤方法。
- 卡方检验与多项式朴素贝叶斯结合随机子空间集成,在 Electronics 数据集上达到 84.75% 的 F1 分数,在 Kitchen 数据集上达到 84.5%。
- 使用随机子空间训练的特征选择模型优于使用 Bagging 的模型,尤其在 Books 与 Electronics 数据集上表现更优。
- 表现最佳的特征选择模型(卡方+MNB+RS)在 Electronics 数据集上达到 84.75% 的 F1 分数,在 Kitchen 数据集上达到 84.5%,甚至超过 TF-MCCNN 与 TF-DCNN 神经网络。
- 与 LSTMs(参数超过 560 万个)相比,基于特征选择与集成方法的模型训练时间显著更短,参数更少(例如 LR 仅 8,001 个参数),从而减少了超参数调优的需求。
- 特征选择技术对词汇外(OOV)词具有鲁棒性,而依赖预训练嵌入的神经网络则难以处理罕见或未见词汇。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。