[论文解读] FENCE: Feasible Evasion Attacks on Neural Networks in Constrained Environments
FENCE 是一种新颖的基于梯度的迭代框架,用于在受限环境中(如网络安保应用)生成可行的逃避攻击,通过尊重特征空间依赖关系。它通过极小且现实的扰动成功逃避了恶意软件和僵尸网络分类器——例如,仅增加12个网络连接——即可将预测结果从'恶意'转变为'良性',同时保持数据的可行性。
As advances in Deep Neural Networks (DNNs) demonstrate unprecedented levels of performance in many critical applications, their vulnerability to attacks is still an open question. We consider evasion attacks at testing time against Deep Learning in constrained environments, in which dependencies between features need to be satisfied. These situations may arise naturally in tabular data or may be the result of feature engineering in specific application domains, such as threat detection in cyber security. We propose a general iterative gradient-based framework called FENCE for crafting evasion attacks that take into consideration the specifics of constrained domains and application requirements. We apply it against Feed-Forward Neural Networks trained for two cyber security applications: network traffic botnet classification and malicious domain classification, to generate feasible adversarial examples. We extensively evaluate the success rate and performance of our attacks, compare their improvement over several baselines, and analyze factors that impact the attack success rate, including the optimization objective and the data imbalance. We show that with minimal effort (e.g., generating 12 additional network connections), an attacker can change the model's prediction from the Malicious class to Benign and evade the classifier. We show that models trained on datasets with higher imbalance are more vulnerable to our FENCE attacks. Finally, we demonstrate the potential of performing adversarial training in constrained domains to increase the model resilience against these evasion attacks.
研究动机与目标
- 解决深度神经网络在必须保留特征依赖关系的受限环境中易受逃避攻击的漏洞。
- 开发一种可泛化的框架,支持现实应用(如网络流量和恶意软件分类)中常见的线性和非线性特征约束。
- 在真实网络安全用例中评估 FENCE 的有效性,包括僵尸网络检测和恶意域名检测。
- 分析数据不平衡和优化目标对攻击成功率的影响。
- 探索对抗性训练作为受限、领域特定环境下的防御机制的潜力。
提出的方法
- FENCE 使用迭代优化过程,计算攻击者目标函数相对于每个特征的梯度。
- 在每次迭代中,识别出与梯度最大特征相关的特征族,并集体修改这些特征以保留可行性约束。
- 对从原始输入的总扰动距离施加上界,以确保变化最小且现实。
- 该框架支持线性和非线性约束,使其适用于具有复杂特征依赖关系的多样化领域。
- 集成两种优化目标:投影梯度下降(PGD)和惩罚法(Carlini-Wagner),并比较其性能。
- FENCE 确保所有中间和最终的对抗性样本均位于由特定领域约束定义的可行区域内。
实验结果
研究问题
- RQ1在必须保留特征依赖关系的受限领域(如网络流量或恶意软件分类)中,能否有效实施逃避攻击?
- RQ2在受限设置中,优化目标的选择(PGD 与 Carlini-Wagner)如何影响对抗性样本的成功率和可行性?
- RQ3训练数据集中的数据不平衡在多大程度上影响 DNN 对 FENCE 风格逃避攻击的脆弱性?
- RQ4在受限环境中进行对抗性训练能否作为提升模型对 FENCE 类攻击鲁棒性的防御机制?
- RQ5在真实网络安全工作负载中,现实且最小的扰动(例如,增加12个网络连接)如何影响分类器的预测结果?
主要发现
- FENCE 能够成功生成可行的对抗性样本,通过极小且现实的更改,在网络安全应用(如僵尸网络和恶意域名分类)中逃避 DNN 分类器。
- 在 Zeek 连接日志中仅增加12个网络连接,就足以使恶意样本的预测从'恶意'变为'良性',从而在流量分类器中成功逃避检测。
- 发现数据集类别不平衡程度较高的模型对 FENCE 攻击更为脆弱,表明数据不平衡会加剧模型的易受攻击性。
- 与 Carlini-Wagner 惩罚法相比,FENCE 中基于 PGD 的优化在攻击成功率和生成样本的可行性方面表现更优。
- 在受限领域中进行对抗性训练显示出作为防御机制的潜力,可增强模型对 FENCE 风格逃避攻击的鲁棒性。
- 标准的连续域对抗性训练方法(如 PGD)在受限环境中不足以提供充分保护,因此需要像 FENCE 这类具备领域感知能力的攻击与防御框架。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。