Skip to main content
QUICK REVIEW

[论文解读] Sentiment Analysis: Predicting Yelp Scores

Bhanu Prakash Reddy Guda, Mashrin Srivastava|arXiv (Cornell University)|Jan 20, 2022
Sentiment Analysis and Opinion Mining被引用 4
一句话总结

本文提出了一种新颖的多任务联合 BERT 模型,通过融合 Yelp 评论文本和元特征来预测情感,其性能优于基线模型。该模型利用注意力机制和情感分数的联合学习,实现了更高的准确率和可解释性,同时在不同评论数量的餐厅之间保持了均衡的性能。

ABSTRACT

In this work, we predict the sentiment of restaurant reviews based on a subset of the Yelp Open Dataset. We utilize the meta features and text available in the dataset and evaluate several machine learning and state-of-the-art deep learning approaches for the prediction task. Through several qualitative experiments, we show the success of the deep models with attention mechanism in learning a balanced model for reviews across different restaurants. Finally, we propose a novel Multi-tasked joint BERT model that improves the overall classification performance.

研究动机与目标

  • 开发一种基于文本和元特征的稳健情感预测模型,用于 Yelp 餐厅评论。
  • 评估深度学习模型(特别是带有注意力机制的 BERT)在捕捉多样化餐厅评论中细微情感差异方面的有效性。
  • 探究与情感分数联合学习是否能提升分类性能和模型泛化能力。
  • 通过注意力可视化分析模型可解释性,并识别与隐含情感线索相关的问题案例。
  • 确保在低评论量或高评论量餐厅之间保持性能均衡,避免数据偏差。

提出的方法

  • 该模型采用多任务联合 BERT 架构,同时以评论文本和元特征作为输入进行情感分类。
  • 利用注意力机制突出文本中对情感预测有贡献的关键词语,从而提升可解释性。
  • 模型在两个目标上进行联合训练:预测星级评分(二分类:1–3 星 vs. 4–5 星)和预测基于 AFINN 的情感分数。
  • 特征工程包括删除二值化词语出现特征以防止过拟合,并仅保留与情感相关的特征。
  • 数据集按 70% 训练集、15% 验证集和 15% 测试集进行划分,并经过预处理,去除如评论者姓名和字符数等无关特征。
  • 模型训练采用早停法以防止过拟合,性能通过准确率、损失曲线和混淆矩阵进行评估。

实验结果

研究问题

  • RQ1与仅使用文本相比,联合建模元特征和文本在情感预测性能方面有何提升?
  • RQ2为何模型在 5 星分类中的表现劣于二元情感分类?造成这种混淆的原因是什么?
  • RQ3注意力机制能否有效突出与情感相关的关键词语?这是否提升了模型的可解释性?
  • RQ4模型是否对评论量较多的餐厅存在偏见?其在低、高评论量餐厅之间的性能是否保持均衡?
  • RQ5在依赖隐含情感线索或外部知识的评论中,会涌现出哪些类型的失败案例?

主要发现

  • 多任务联合 BERT 模型在二元情感分类和 5 星情感分类中均优于所有基线模型,在 Yelp 数据集上实现了最先进性能。
  • 注意力机制成功突出如 'perfect' 和 'bad' 等情感显著词语,证实了模型的可解释性及其与人类判断的一致性。
  • 模型对高评论量餐厅无显著偏见,所有餐厅的性能保持均衡。
  • 5 星分类中的混淆主要出现在相邻类别之间(如 3 星 vs. 4 星),表明模型在区分细微情感差异方面存在困难。
  • 在依赖隐含情感线索(如烹饪隐喻)的评论中会出现失败案例,表明需要引入知识图谱以增强理解。
  • 训练损失持续下降,验证损失趋于稳定,证实模型通过早停法实现了有效收敛,且未出现过拟合。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。