Skip to main content
QUICK REVIEW

[论文解读] Building an Effective Email Spam Classification Model with spaCy

Kazem Taghandiki|arXiv (Cornell University)|Mar 15, 2023
Spam and Phishing Detection被引用 4
一句话总结

本文提出了一种使用spaCy进行NLP预处理,并在1,500封Gmail邮件数据集上应用三种机器学习模型——朴素贝叶斯、C45决策树和多层感知机(MLP)——的垃圾邮件检测系统。MLP模型实现了96%的最高准确率,表现出色,精确率高达97%,F1得分达到96%。

ABSTRACT

Today, people use email services such as Gmail, Outlook, AOL Mail, etc. to communicate with each other as quickly as possible to send information and official letters. Spam or junk mail is a major challenge to this type of communication, usually sent by botnets with the aim of advertising, harming and stealing information in bulk to different people. Receiving unwanted spam emails on a daily basis fills up the inbox folder. Therefore, spam detection is a fundamental challenge, so far many works have been done to detect spam using clustering and text categorisation methods. In this article, the author has used the spaCy natural language processing library and 3 machine learning (ML) algorithms Naive Bayes (NB), Decision Tree C45 and Multilayer Perceptron (MLP) in the Python programming language to detect spam emails collected from the Gmail service. Observations show the accuracy rate (96%) of the Multilayer Perceptron (MLP) algorithm in spam detection.

研究动机与目标

  • 为应对垃圾邮件日益增长的挑战,此类问题会危及用户安全和邮箱完整性。
  • 利用现代NLP技术构建一个稳健的文本分类流程,以实现有效的垃圾邮件检测。
  • 在真实世界邮件数据集上评估并比较朴素贝叶斯、C45决策树和多层感知机的性能。
  • 展示spaCy在为下游机器学习任务预处理邮件文本方面的有效性。
  • 为电子邮件系统中的自动垃圾邮件过滤提供一种高准确率、可扩展的解决方案。

提出的方法

  • 从Gmail收集了1,500封邮件样本(1,125封用于训练,375封用于测试),并标注为垃圾邮件或正常邮件。
  • 使用spaCy进行文本预处理,包括分词、词形还原、停用词移除和词性标注。
  • 使用scikit-learn实现的朴素贝叶斯、C45决策树和多层感知机进行模型训练。
  • 基于邮件内容提取的预处理文本特征,使用词袋模型或类似向量化方法进行训练。
  • 使用标准指标(准确率、精确率、召回率和F1得分)在测试集上评估模型性能。
  • 采用混淆矩阵和性能可视化方法比较各模型结果。
Figure 1: Implementation process of the proposed approach
Figure 1: Implementation process of the proposed approach

实验结果

研究问题

  • RQ1基于spaCy的文本预处理是否能显著提升机器学习模型在垃圾邮件分类中的性能?
  • RQ2在真实Gmail数据集上,朴素贝叶斯、C45决策树和多层感知机在区分垃圾邮件与正常邮件方面表现如何比较?
  • RQ3在使用传统机器学习模型进行垃圾邮件检测时,精确率、召回率和准确率之间应如何达到最佳平衡?
  • RQ4机器学习算法的选择在多大程度上影响了对恶意或欺骗性邮件内容的检测能力?
  • RQ5在这一特定垃圾邮件分类任务中,多层感知机是否能优于朴素贝叶斯和决策树等简单模型?

主要发现

  • 多层感知机(MLP)模型在垃圾邮件分类中实现了最高的96%准确率。
  • MLP模型的精确率为97%,F1得分为96%,表明其在减少误报方面表现优异,且精确率与召回率保持良好平衡。
  • C45决策树模型的召回率最高(95%),表明其在识别实际垃圾邮件方面优于其他模型。
  • 朴素贝叶斯模型表现中等,相比MLP准确率和F1得分均较低,表明其在捕捉邮件文本中复杂模式方面存在局限。
  • 使用spaCy进行预处理——包括词形还原、停用词移除和分词——显著提升了所有算法的模型性能。
  • 混淆矩阵证实,MLP的误分类样本数量最少,尤其显著降低了假阴性数量。
Figure 2: Tokenisation pre-processing
Figure 2: Tokenisation pre-processing

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。