[论文解读] Enhancing Robustness of Deep Neural Networks Against Adversarial Malware Samples: Principles, Framework, and AICS'2019 Challenge
本文提出了一套系统性框架,以增强深度神经网络对对抗性恶意软件逃避攻击的鲁棒性,整合了语义保持表示学习、二值化、基于最优攻击的对抗训练以及集成学习等原则。该方法应用于 AICS'2019 恶意软件分类挑战赛,提交了对 3,133 个测试样本在五个类别中的预测结果,目前等待评估。
Malware continues to be a major cyber threat, despite the tremendous effort that has been made to combat them. The number of malware in the wild steadily increases over time, meaning that we must resort to automated defense techniques. This naturally calls for machine learning based malware detection. However, machine learning is known to be vulnerable to adversarial evasion attacks that manipulate a small number of features to make classifiers wrongly recognize a malware sample as a benign one. The state-of-the-art is that there are no effective countermeasures against these attacks. Inspired by the AICS'2019 Challenge, we systematize a number of principles for enhancing the robustness of neural networks against adversarial malware evasion attacks. Some of these principles have been scattered in the literature, but others are proposed in this paper for the first time. Under the guidance of these principles, we propose a framework and an accompanying training algorithm, which are then applied to the AICS'2019 challenge. Our experimental results have been submitted to the challenge organizer for evaluation.
研究动机与目标
- 解决日益增长的对抗性恶意软件逃避攻击对基于机器学习的恶意软件检测器构成的威胁。
- 系统化地整合提升深度神经网络在恶意软件分类中鲁棒性的原则,特别是针对 $ε$-扰动攻击。
- 设计一个统一框架,集成输入变换、对抗训练和集成学习,以提升防御能力。
- 将该框架应用于 AICS'2019 恶意软件分类挑战赛,并提交预测结果以供评估。
- 激发未来在恶意软件检测中针对逃避攻击和投毒攻击的鲁棒性研究。
提出的方法
- 提出一个由六个原则指导的框架,包括使用最优白盒攻击来界定灰盒攻击能力,以及采用语义保持表示学习。
- 应用二值化以缩小扰动空间,将连续特征转换为二进制形式,从而限制对抗性操纵。
- 使用基于梯度优化(Adam)的对抗训练,生成并整合对抗样本以进行模型训练。
- 采用由 10 个深度神经网络组成的集成模型,每个网络包含两个 160 个神经元的全连接层及 ELU 激活函数,通过输入变换和对抗正则化进行训练。
- 应用随机子空间方法,其中 $Λ = 0.5$,以增强基础模型的多样性并提高鲁棒性。
- 将扰动输入投影到 $[0,1]$ 区间,并四舍五入为二进制值,以强化对小规模特征扰动的鲁棒性。
实验结果
研究问题
- RQ1如何通过原则化设计系统性地增强恶意软件分类中的对抗鲁棒性?
- RQ2语义保持表示学习在多大程度上能提升分类器对对抗扰动的鲁棒性?
- RQ3使用最优攻击近似的对抗训练能否改善对灰盒攻击的泛化能力?
- RQ4结合输入变换与对抗训练的集成学习在防御对抗性恶意软件样本方面有多有效?
- RQ5当特征值被归一化且不存在负值时,可使用哪些指标来检测对抗样本?
主要发现
- 该框架已应用于 AICS'2019 挑战赛,已提交 3,133 个测试样本的分类结果以供评估。
- 模型预测结果为:类别 '0' 有 2,245 个样本,类别 '1' 有 461 个,类别 '2' 有 162 个,类别 '3' 有 176 个,类别 '4' 有 89 个。
- 测试样本中的非零特征数量通常与训练样本相似,但部分测试样本的非零条目超过 1,200 个,表明可能存在扰动。
- 非零特征的平均数量远小于输入维度(106,428),表明扰动是稀疏的。
- 采用二值化后,扰动空间被限制为仅两种变化类型:1→0 和 0→1,有效降低了对小规模扰动的敏感性。
- 通过 55 次 Adam 优化器迭代的对抗训练,结合输入投影至 $[0,1]$ 区间,显著提升了模型对对抗样本的鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。