[论文解读] Yelp Review Rating Prediction: Machine Learning and Deep Learning Models
本文提出了一项关于机器学习与基于变压器架构的深度学习模型在预测Yelp餐厅评分方面的对比研究。基于Yelp开放数据集中的平衡训练数据集,评估了传统模型(逻辑回归、SVM、随机森林、朴素贝叶斯)和先进变压器模型(BERT、DistilBERT、RoBERTa、XLNet),发现XLNet在测试集上取得了70.44%的最高准确率,显著优于表现最佳的传统机器学习模型(逻辑回归,准确率为64%)。
We predict restaurant ratings from Yelp reviews based on Yelp Open Dataset. Data distribution is presented, and one balanced training dataset is built. Two vectorizers are experimented for feature engineering. Four machine learning models including Naive Bayes, Logistic Regression, Random Forest, and Linear Support Vector Machine are implemented. Four transformer-based models containing BERT, DistilBERT, RoBERTa, and XLNet are also applied. Accuracy, weighted F1 score, and confusion matrix are used for model evaluation. XLNet achieves 70% accuracy for 5-star classification compared with Logistic Regression with 64% accuracy.
研究动机与目标
- 仅使用评论文本预测1-5星Yelp餐厅评分,将其建模为多分类问题。
- 通过构建每类评分250,000个样本的平衡训练集,解决Yelp开放数据集中存在的数据不平衡问题。
- 评估传统机器学习模型与最先进变压器架构模型在评分预测任务中的性能表现。
- 比较模型架构、大小写敏感与不敏感分词方式以及超参数设置对预测准确率和F1分数的影响。
- 为现实世界中的评论评分系统部署提供关于模型性能、推理速度与计算成本之间权衡的见解。
提出的方法
- 通过从原始Yelp开放数据集中重采样125,000条评论(每颗星评分250,000个样本),构建了平衡的训练数据集,以缓解类别不平衡问题。
- 应用两种文本向量化技术——词袋模型(Count Vectorizer)与TF-IDF向量化器,使用单字词、双字词、小写转换、停用词移除以及最小文档频率为5的设置。
- 在特征工程后的数据上训练了四种传统机器学习模型:朴素贝叶斯、逻辑回归、随机森林和线性SVM。
- 使用最大序列长度为128的不区分大小写与区分大小写的基线架构,对四种变压器模型(BERT、DistilBERT、RoBERTa、XLNet)进行微调。
- 通过在验证集和测试集上评估模型,对批量大小(16)、初始学习率和训练周期数(1)等超参数进行优化。
- 使用准确率、加权F1分数和混淆矩阵评估模型,以分析各类别的性能表现与预测偏差。
实验结果
研究问题
- RQ1传统机器学习模型与基于变压器的模型在从文本预测Yelp评论评分方面表现如何?
- RQ2数据不平衡对模型性能有何影响?通过重采样构建平衡训练集的方法有多有效?
- RQ3在Yelp评分预测任务中,哪种变压器架构——BERT、DistilBERT、RoBERTa或XLNet——能实现最高的准确率与F1分数?
- RQ4大小写敏感与不敏感分词方式以及模型规模(基线与大型)如何影响预测性能与计算效率?
- RQ5混淆矩阵在多大程度上揭示了模型在区分相邻评分类别(如4星与5星)方面的优劣势?
主要发现
- XLNet在测试集上取得了70.44%的最高准确率,显著优于逻辑回归(在相同测试集上准确率为64%)。
- RoBERTa的性能优于BERT,测试准确率达到69.61%,加权F1分数为0.6999,表明其在预训练过程中具有更强的鲁棒性。
- DistilBERT的准确率比BERT低约0.5%(不区分大小写的基线模型为69.61% vs. 69.61%),但推理速度接近两倍,使其在资源受限环境中成为强有力的选择。
- 混淆矩阵显示,变压器模型(尤其是XLNet和RoBERTa)具有更强的主对角线优势,表明其在类别间区分能力更强,尤其在2–4星评分之间。
- 区分大小写的模型普遍优于不区分大小写的模型,其中区分大小写的XLNet达到最高准确率,表明对此任务而言,大小写敏感性有助于提升表征学习能力。
- 表现最佳的模型(XLNet)取得了0.7044的加权F1分数,显著优于表现最佳的传统机器学习模型(逻辑回归,F1分数为0.64),凸显了上下文表征在评分预测中的优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。