[论文解读] Sentiment Analysis of Yelp Reviews: A Comparison of Techniques and Models
本研究评估了362,554条Yelp评论中用于情感分析的文本预处理方法及机器学习/深度学习模型,比较了多伦多5,000家餐厅的表现。以宏F1分数为度量标准,研究发现尽管使用了预训练嵌入和序列长度截断,简单的模型如逻辑回归和SVM仍优于复杂的模型如BERT和LSTM。
We use over 350,000 Yelp reviews on 5,000 restaurants to perform an ablation study on text preprocessing techniques. We also compare the effectiveness of several machine learning and deep learning models on predicting user sentiment (negative, neutral, or positive). For machine learning models, we find that using binary bag-of-word representation, adding bi-grams, imposing minimum frequency constraints and normalizing texts have positive effects on model performance. For deep learning models, we find that using pre-trained word embeddings and capping maximum length often boost model performance. Finally, using macro F1 score as our comparison metric, we find simpler models such as Logistic Regression and Support Vector Machine to be more effective at predicting sentiments than more complex models such as Gradient Boosting, LSTM and BERT.
研究动机与目标
- 为从业者提供在情感分析中选择有效文本预处理和模型选择策略的指导。
- 评估各种文本预处理技术(如停用词去除、标准化和n-gram添加)对模型性能的影响。
- 比较传统机器学习模型(如逻辑回归、SVM)与深度学习模型(如LSTM、BERT)在从Yelp评论中预测情感方面的有效性。
- 评估模型复杂度、性能与可解释性之间在多分类情感分类中的权衡。
- 为深度学习模型的超参数选择(如序列长度截断和词汇表大小)提供实证见解。
提出的方法
- 通过多项式朴素贝叶斯基线进行文本预处理的消融研究,以评估各项技术的单独影响。
- 在预处理后的Yelp评论上训练并比较多种模型:逻辑回归、SVM、梯度提升、LSTM和BERT。
- 使用二值袋模型(binary bag-of-words)并添加bigram特征,结合最小频率约束和文本标准化,以提升机器学习模型的性能。
- 采用预训练的GloVe嵌入,并将最大序列长度限制在200个标记,以增强深度学习模型的泛化能力。
- 在LSTM架构中应用早停法和Dropout层,以减少过拟合。
- 使用宏F1分数评估所有模型,该分数计算为各类别F1分数的未加权平均,以应对类别不平衡问题。
实验结果
研究问题
- RQ1不同的文本预处理技术(如停用词去除、标准化)如何影响情感分类性能?
- RQ2在Yelp评论情感分类中,哪种机器学习模型——逻辑回归、SVM或梯度提升——表现最佳?
- RQ3在宏F1分数和训练效率方面,LSTM和BERT等深度学习模型与传统模型相比如何?
- RQ4哪些超参数选择(如序列长度截断、词汇表大小)对提升深度学习模型性能影响最大?
- RQ5模型复杂度是否与性能正相关?还是更简单的、可解释性更强的模型反而优于复杂模型?
主要发现
- 更简单的模型如逻辑回归和支持向量机在宏F1分数上优于更复杂的模型如梯度提升、LSTM和BERT。
- 文本标准化、最小频率约束以及bigram特征添加显著提升了传统机器学习模型的性能。
- 对于深度学习模型,使用预训练的GloVe嵌入并将序列长度限制在200个标记,显著提升了泛化能力并减少了过拟合。
- 将词汇表大小限制在5,000个词,可提升使用预训练嵌入时的性能,而更大的词汇表反而导致性能下降。
- LSTM模型在分类正面情感时错误率较高(34%被误分类为中性),主要原因是评论长度较短以及序列长度限制。
- 尽管计算成本更高,BERT和LSTM模型在宏F1分数上并未超越简单模型,且由于缺乏可解释性,需要借助LIME等额外工具进行分析。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。