[论文解读] DomainGAN: Generating Adversarial Examples to Attack Domain Generation Algorithm Classifiers
本文提出 DomainGAN,一种基于 GAN 的方法,通过模仿良性域名特征,生成可规避最先进 DGA 分类器的对抗性域名。采用三种 GAN 变体——带梯度惩罚的 Wassertein GAN(WGANGP)优于 GAN 和 LSGAN,该方法生成的域名碰撞率更低、逃逸率更高,因此 WGANGP 在进攻用途中最具优势,因其具备更优越的可用性与逃逸能力。
Domain Generation Algorithms (DGAs) are frequently used to generate numerous domains for use by botnets. These domains are often utilized as rendezvous points for servers that malware has command and control over. There are many algorithms that are used to generate domains, however many of these algorithms are simplistic and easily detected by traditional machine learning techniques. In this paper, three variants of Generative Adversarial Networks (GANs) are optimized to generate domains which have similar characteristics of benign domains, resulting in domains which greatly evade several state-of-the-art deep learning based DGA classifiers. We additionally provide a detailed analysis into offensive usability for each variant with respect to repeated and existing domain collisions. Finally, we fine-tune the state-of-the-art DGA classifiers by adding GAN generated samples to their original training datasets and analyze the changes in performance. Our results conclude that GAN based DGAs are superior in evading DGA classifiers in comparison to traditional DGAs, and of the variants, the Wasserstein GAN with Gradient Penalty (WGANGP) is the highest performing DGA for uses both offensively and defensively.
研究动机与目标
- 开发一种基于 GAN 的域名生成算法(DGA),通过生成与良性域名难以区分的域名,实现对最先进深度学习 DGA 分类器的规避。
- 通过分析域名长度、n-gram 分布及碰撞率(重复与现存域名碰撞),评估 GAN 生成域名在进攻场景下的可用性。
- 比较三种 GAN 变体(GAN、LSGAN、WGANGP)在逃逸准确率与僵尸网络 C2 运维实际可用性方面的性能表现。
- 通过微调现有 DGA 分类器以使用 GAN 生成的对抗样本,并测量其性能下降情况,评估其防御影响。
- 探索架构与损失函数改进方案,以提升 GAN 生成域名的质量与可用性。
提出的方法
- 在 Alexa Top 1 Million 数据集上训练三种 GAN 变体——标准 GAN、LSGAN 和 WGANGP,以学习真实良性域名的分布特征。
- 采用条件生成器结合噪声向量生成域名字符串,确保 C2 协调中输出的确定性。
- 使用判别器网络区分真实良性域名与 GAN 生成的域名,并通过对抗训练优化生成器。
- 在 WGANGP 中应用梯度惩罚以稳定训练过程并改善模式覆盖,减少模式崩溃现象。
- 将生成的域名提交给五种最先进 DGA 分类器(如 Invincea、CMU、MIT、NYU、Baseline)进行评估,以测量其逃逸性能。
- 通过测量 100 万个生成域名的重复域名碰撞率、现存域名碰撞率及分类器检测率,开展可用性分析。
实验结果
研究问题
- RQ1基于 GAN 的 DGA 是否能比传统算法型 DGA 更有效地规避现代深度学习 DGA 分类器?
- RQ2在考虑碰撞率与长度限制的前提下,哪种 GAN 变体(标准 GAN、LSGAN 或 WGANGP)生成的域名在僵尸网络进攻操作中最具可用性?
- RQ3在 GAN 生成的对抗样本上微调现有 DGA 分类器,对其检测性能有何影响?
- RQ4GAN 生成的域名在多大程度上匹配真实良性域名的 n-gram 分布,从而增强其逃逸潜力?
- RQ5哪些架构或损失函数的改进可进一步提升基于 GAN 的 DGA 在可用性与逃逸能力方面的表现?
主要发现
- WGANGP 变体实现了最高的逃逸率,其生成的域名中有 56.43% 成功规避了 Invincea DGA 分类器的检测,显著优于 GAN(3.24%)和 LSGAN(36.01%)。
- WGANGP 生成的域名重复域名碰撞率(11.39%)与现存域名碰撞率(11.39%)最低,表明其在进攻部署中最具可用性。
- 基线 DGA 分类器检测到 89.50% 的 GAN 生成域名、64.07% 的 LSGAN 生成域名以及 89.50% 的 WGANGP 生成域名,表明 WGANGP 生成的域名在逃逸方面具有显著优势。
- 使用 GAN 生成的对抗样本微调 DGA 分类器后,其检测准确率下降,表明生产系统亟需具备对抗鲁棒性。
- WGANGP 生成的域名与真实良性域名的 n-gram 分布相似度更高,且避免了以往基于 GAN 的 DGA 常见的短域名问题,显著提升了实际可用性。
- 本研究证实,基于 GAN 的 DGA 比传统算法型 DGA 更有效地规避现代 DGA 分类器,且 WGANGP 是进攻与防御应用中的最优选择。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。