[论文解读] Semi-supervised Conditional GAN for Simultaneous Generation and Detection of Phishing URLs: A Game theoretic Perspective
本文提出了一种半监督条件生成对抗网络,通过博弈论训练策略,同时生成对抗性钓鱼URL并检测恶意URL。该模型在钓鱼URL检测任务中达到95.52%的准确率,在对抗性样本检测中达到87.45%的准确率,推理速度达每URL 0.64毫秒,实现实时处理。
Spear Phishing is a type of cyber-attack where the attacker sends hyperlinks through email on well-researched targets. The objective is to obtain sensitive information by imitating oneself as a trustworthy website. In recent times, deep learning has become the standard for defending against such attacks. However, these architectures were designed with only defense in mind. Moreover, the attacker's perspective and motivation are absent while creating such models. To address this, we need a game-theoretic approach to understand the perspective of the attacker (Hacker) and the defender (Phishing URL detector). We propose a Conditional Generative Adversarial Network with novel training strategy for real-time phishing URL detection. Additionally, we train our architecture in a semi-supervised manner to distinguish between adversarial and real examples, along with detecting malicious and benign URLs. We also design two games between the attacker and defender in training and deployment settings by utilizing the game-theoretic perspective. Our experiments confirm that the proposed architecture surpasses recent state-of-the-art architectures for phishing URLs detection.
研究动机与目标
- 通过在攻击者与防御者之间引入博弈论推理,弥补现有钓鱼URL检测模型缺乏攻击者视角的不足。
- 构建统一框架,同时生成对抗性钓鱼URL并检测恶意URL,提升对零日攻击的鲁棒性。
- 通过利用字符级深度学习与对抗性训练,克服传统黑白名单及基于特征模型的局限性。
- 通过轻量化架构与高效推理(每URL 0.64毫秒),实现客户端与服务端监控的实时部署。
- 通过半监督学习在真实与合成对抗性样本上联合训练判别器与生成器,提升模型鲁棒性。
提出的方法
- 提出一种条件生成对抗网络,其生成器接收真实良性或恶意URL、噪声向量及类别标签,以合成对抗性URL。
- 设计一种新颖的三阶段训练策略:首先预训练判别器,然后使用重建损失微调生成器,最后联合微调两个网络并采用加权总损失。
- 通过在已标注真实URL与未标注数据上联合训练,实现半监督学习,提升泛化能力与对抗性样本检测性能。
- 引入博弈论训练机制:训练阶段在伪攻击者(生成器)与判别器之间进行博弈;部署阶段在真实黑客与防御者之间进行博弈。
- 应用多种损失函数,包括重建损失(ℒrec)、均方误差(MSE)、结构相似性(SSIM)与归一化均方根误差(NRMSE),以确保真实URL与生成URL在结构与语义上高度相似。
- 优化判别器以同时检测真实与对抗性样本,实现100%特异性与74.9%的召回率(敏感性)在对抗性输入上。
实验结果
研究问题
- RQ1能否在半监督设置下有效训练条件生成对抗网络,以生成逼真的对抗性钓鱼URL,同时检测恶意URL?
- RQ2在攻击者与防御者之间引入博弈论视角,如何提升钓鱼URL检测模型的鲁棒性与泛化能力?
- RQ3所提模型在检测良性与恶意URL方面,相较于现有SOTA架构,性能提升程度如何?
- RQ4判别器在50/50真实样本与对抗性样本测试集下,检测生成器所生成对抗性样本的效率如何?
- RQ5该模型能否在客户端或服务端环境中维持高推理速度与低延迟,实现实时部署?
主要发现
- 所提模型在良性/恶意钓鱼URL分类任务中达到95.52%准确率、96.00%敏感性与0.9552 AUC,优于所有对比的SOTA模型。
- 生成器生成的对抗性URL在SSIM评分达98.33%,MSE为0.000579,NRMSE为0.19708,表明与真实URL具有高度结构相似性。
- 判别器在对抗性样本检测中达到87.45%准确率、74.9%敏感性(召回率)与100%完美特异性,展现出强大鲁棒性。
- 模型每推理一次仅需0.64毫秒,支持每秒处理超过1,500个URL,实现真正实时性能。
- 该架构参数量仅81,000个,轻量化设计,适用于资源受限环境部署。
- 尽管参数量更少,该模型显著优于基于DC-GAN与混合CNN-LSTM的模型(如[24]),表明其具备更高的效率与泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。