Skip to main content
QUICK REVIEW

[论文解读] Phishing Detection through Email Embeddings

Luis Felipe González Gutiérrez, Faranak Abri|arXiv (Cornell University)|Dec 28, 2020
Spam and Phishing Detection参考文献 21被引用 4
一句话总结

本文提出使用基于doc2vec的邮件嵌入来检测钓鱼邮件,通过捕捉语义内容,即使钓鱼邮件与正常邮件在表面特征上高度相似,也能实现有效区分。尽管在文本指标上相似度极高,该方法在2D线性PCA投影的嵌入上使用随机森林分类器,仍实现了91.6%的准确率和90.0%的F1分数,表明语义向量化能有效区分钓鱼邮件与正常邮件。

ABSTRACT

The problem of detecting phishing emails through machine learning techniques has been discussed extensively in the literature. Conventional and state-of-the-art machine learning algorithms have demonstrated the possibility of building classifiers with high accuracy. The existing research studies treat phishing and genuine emails through general indicators and thus it is not exactly clear what phishing features are contributing to variations of the classifiers. In this paper, we crafted a set of phishing and legitimate emails with similar indicators in order to investigate whether these cues are captured or disregarded by email embeddings, i.e., vectorizations. We then fed machine learning classifiers with the carefully crafted emails to find out about the performance of email embeddings developed. Our results show that using these indicators, email embeddings techniques is effective for classifying emails as phishing or legitimate.

研究动机与目标

  • 探究在文本特征几乎完全相同的情况下,基于邮件嵌入训练的机器学习模型是否能有效区分钓鱼邮件与正常邮件。
  • 评估doc2vec嵌入在钓鱼邮件与正常邮件内容表面相似的情况下,捕捉语义差异的有效性。
  • 确定邮件嵌入是否保留了可区分特征,使得即使传统特征无法区分,也能实现高精度分类。
  • 比较多种分类器(SVM、逻辑回归、随机森林、朴素贝叶斯)在完整嵌入空间和低维投影上的性能表现。
  • 通过解释方差和降维技术(线性与RBF核PCA)分析邮件嵌入的潜在结构。

提出的方法

  • 构建了一个包含12封钓鱼邮件和12封正常邮件的数据集,其语言和结构特征被刻意设计为高度相似,以隔离语义差异。
  • 应用doc2vec将每封邮件转换为20维的密集向量表示,以捕捉其语义含义。
  • 在完整的20维嵌入空间上训练多种二分类器——SVM、逻辑回归、随机森林和朴素贝叶斯。
  • 使用线性PCA和RBF核PCA进行降维,将嵌入投影至2D以实现可视化和分析。
  • 通过准确率和F1分数评估不同嵌入表示和分类器类型下的模型性能。
  • 进行解释方差分析,以确定前几个主成分能捕获嵌入中总方差的多少比例。

实验结果

研究问题

  • RQ1当钓鱼邮件与正常邮件在表面特征上几乎完全相同时,邮件嵌入是否能有效区分两者?
  • RQ2在doc2vec生成的邮件嵌入上训练时,不同机器学习分类器的性能表现如何?
  • RQ3邮件嵌入的潜在结构是否支持语义空间中的线性或非线性可分性?
  • RQ4嵌入空间中多大比例的方差足以实现高分类准确率?
  • RQ52D嵌入投影在在多大程度上保留了原始20维特征空间的判别能力?

主要发现

  • 当使用嵌入的2D线性PCA投影时,随机森林分类器实现了最高的准确率(91.6%)和F1分数(90.0%),尽管仅使用了原始方差的25%。
  • SVM在原始20维嵌入空间中表现最佳,准确率为81.6%,F1分数为76.6%。
  • 2D线性PCA投影优于原始20维空间和RBF核PCA投影,表明嵌入的潜在结构近似为线性。
  • RBF核PCA投影的性能略低(准确率78.3%,F1分数76.6%),表明在此非线性投影中类别分割效果较差。
  • 解释方差分析显示,前12个主成分捕获了总方差的90%,突显了嵌入空间的低内在维度。
  • 多种分类器和投影方式下均保持高性能,表明doc2vec嵌入能有效编码钓鱼邮件与正常邮件之间的语义差异。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。