Skip to main content
QUICK REVIEW

[论文解读] Phishing Detection Using Machine Learning Techniques

Vahid Shahrivari, Mohammad Mahdi Darabi|arXiv (Cornell University)|Sep 20, 2020
Spam and Phishing Detection被引用 15
一句话总结

本文使用包含11,055个网站(6,157个合法网站,4,898个钓鱼网站)的数据集,评估了九种机器学习模型——逻辑回归、决策树、随机森林、AdaBoost、支持向量机(SVM)、K近邻(KNN)、神经网络、梯度提升和XGBoost——在钓鱼网站检测中的表现。XGBoost在F1得分和训练速度方面均表现最佳,优于其他模型,尤其在小样本数据集上,这得益于其正则化、学习率和特征子采样机制,同时在泛化能力方面也优于神经网络,尽管训练时间更长且缺乏可解释性。

ABSTRACT

The Internet has become an indispensable part of our life, However, It also has provided opportunities to anonymously perform malicious activities like Phishing. Phishers try to deceive their victims by social engineering or creating mock-up websites to steal information such as account ID, username, password from individuals and organizations. Although many methods have been proposed to detect phishing websites, Phishers have evolved their methods to escape from these detection methods. One of the most successful methods for detecting these malicious activities is Machine Learning. This is because most Phishing attacks have some common characteristics which can be identified by machine learning methods. In this paper, we compared the results of multiple machine learning methods for predicting phishing websites.

研究动机与目标

  • 评估并比较多种机器学习算法在检测钓鱼网站方面的性能。
  • 基于准确率、训练速度和泛化能力,识别出最有效的钓鱼网站检测模型。
  • 分析超参数调优和模型架构对检测性能的影响。
  • 探讨模型可解释性、计算成本与检测效果之间的权衡。
  • 通过公开共享的数据集和代码,为未来研究提供可复现的基准。

提出的方法

  • 本研究采用九种监督学习分类器:逻辑回归、决策树、随机森林、AdaBoost、支持向量机(SVM)、K近邻(KNN)、神经网络、梯度提升和XGBoost。
  • 从网站URL和内容中提取特征,包括URL长度、'https'的存在性、'www'的使用情况以及特殊字符的出现。
  • XGBoost通过学习率、特征和样本的子采样以及L2正则化来减少过拟合并提升泛化能力。
  • 神经网络使用Adam优化器和ReLU激活函数进行训练,训练过程在500轮后采用早停策略,并测试了不同隐藏层深度的模型。
  • 通过在不同K值下评估K近邻模型,分析偏差-方差权衡。
  • 模型评估基于标准指标:准确率、F1得分、精确率、召回率和训练时间,结果以对比表格和图表形式呈现。

实验结果

研究问题

  • RQ1哪种机器学习模型在分类钓鱼网站任务中实现了最高的F1得分和准确率?
  • RQ2在中等规模数据集上,不同模型的训练速度和计算效率如何比较,尤其是XGBoost与其它模型的对比?
  • RQ3超参数调优和正则化对模型泛化能力和鲁棒性有何影响?
  • RQ4在可解释性方面,XGBoost与神经网络相比表现如何?
  • RQ5集成方法如随机森林和XGBoost是否在钓鱼网站检测中始终优于单个模型?

主要发现

  • XGBoost在所有模型中取得了最高的F1得分,表明其在钓鱼网站检测任务中表现最为优越。
  • XGBoost是训练速度最快的模型,在计算效率方面显著优于神经网络和SVM。
  • 尽管神经网络采用了更深的架构,但其训练时间远超其他所有模型,且F1得分未超越XGBoost。
  • 随机森林和XGBoost均表现出高准确率和快速推理速度,是实际部署的有力候选者。
  • K近邻在邻居数较少时表现良好,显示出低偏差但高方差;而较大的K值导致决策边界更平滑但灵活性降低。
  • XGBoost通过正则化、学习率和特征子采样相结合,实现了优于神经网络的泛化能力,尤其在小样本数据集上表现更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。