Skip to main content
QUICK REVIEW

[论文解读] Attention-based Bidirectional LSTM for Deceptive Opinion Spam Classification

Ashish Salunkhe|arXiv (Cornell University)|Dec 29, 2021
Spam and Phishing Detection被引用 8
一句话总结

本文提出一种基于注意力机制的双向LSTM模型,用于分类在线评论中的欺骗性意见垃圾信息,利用预训练的GLoVe词嵌入和注意力机制以提升语义理解能力。该方法在欺骗性意见垃圾信息语料库上实现了90.25%的测试准确率,优于传统机器学习模型及其他深度学习架构。

ABSTRACT

Online Reviews play a vital role in e commerce for decision making. Much of the population makes the decision of which places, restaurant to visit, what to buy and from where to buy based on the reviews posted on the respective platforms. A fraudulent review or opinion spam is categorized as an untruthful or deceptive review. Positive reviews of a product or a restaurant helps attract customers and thereby lead to an increase in sales whereas negative reviews may hamper the progress of a restaurant or sales of a product and thereby lead to defamed reputation and loss. Fraudulent reviews are deliberately posted on various online review platforms to trick customers to buy, visit or distract against a product or a restaurant. They are also written to commend or discredit the product's repute. The work aims at detecting and classifying the reviews as deceptive or truthful. It involves use of various deep learning techniques for classifying the reviews and an overview of proposed approach involving Attention based Bidirectional LSTM to tackle issues related to semantic information in reviews and a comparative study over baseline machine learning techniques for review classification.

研究动机与目标

  • 为解决欺骗性在线评论带来的消费者误导及企业声誉损害问题。
  • 通过利用能够捕捉评论文本中序列性和上下文语义模式的深度学习模型,提升分类性能。
  • 通过使用欺骗性与真实评论的平衡数据集,克服数据不平衡问题并增强模型泛化能力。
  • 评估注意力机制在突出显示与欺骗相关的显著词汇和短语方面的有效性。
  • 将所提出的模型与传统机器学习方法及其他深度学习架构在意见垃圾信息检测中的文本分类性能进行比较。

提出的方法

  • 采用双向长短期记忆网络(BiLSTM)建模评论文本中的序列依赖关系,捕捉正向与反向上下文信息。
  • 集成注意力机制,动态加权不同词语和隐藏状态的重要性,聚焦于欺骗性语言线索。
  • 使用预训练的GLoVe词嵌入(50维和100维)将词语表示为密集向量空间中的向量,以改善语义表示。
  • 通过标准预处理技术(包括分词、停用词去除和全小写转换)提升模型输入质量。
  • 在1600条酒店评论的平衡数据集上使用监督学习进行模型训练,标签用于指示情感是否具有欺骗性。
  • 使用标准自然语言处理指标(准确率、精确率、召回率和F1分数)在保留的测试集上评估模型性能。

实验结果

研究问题

  • RQ1基于注意力机制的双向LSTM模型能否有效区分在线评论中的欺骗性与真实性意见垃圾信息?
  • RQ2与标准BiLSTM相比,注意力机制在提升模型识别欺骗性语言模式方面有何改进?
  • RQ3在相同基准数据集上,所提出模型相较于传统机器学习模型(如多项式朴素贝叶斯和SVM)的性能如何?
  • RQ4预训练词嵌入(如GLoVe)在意见垃圾信息检测中对分类准确率的提升程度如何?
  • RQ5与CNN-LSTM及注意力增强型模型等其他深度学习架构相比,该模型在欺骗性意见垃圾信息语料库上的表现如何?

主要发现

  • 采用100维GLoVe嵌入的注意力机制双向LSTM模型在测试集上达到90.25%的准确率,优于大多数基线模型及其他深度学习架构。
  • 该模型在测试集上的F1分数为90.25%,表明其在检测欺骗性评论时精确率与召回率之间具有良好的平衡。
  • 在所有测试的深度学习模型中,注意力机制双向LSTM在验证集上达到最高的验证准确率(99.18%)和测试准确率(90.25%),优于CNN+LSTM和标准BiLSTM模型。
  • 传统模型如多项式朴素贝叶斯和逻辑回归的测试准确率较低(分别为84.5%和79.75%),证实了引入注意力机制的深度学习方法的优越性。
  • 消融实验表明,以评论为中心的特征(如n-gram和字符级TF-IDF向量)表现具有竞争力,但仍逊色于结合注意力机制的深度神经网络。
  • 注意力权重的可视化结果表明,该模型能有效突出关键欺骗性短语和情感异常,验证了其可解释性及对相关语言线索的关注能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。