Skip to main content
QUICK REVIEW

[论文解读] Defending Malware Classification Networks Against Adversarial Perturbations with Non-Negative Weight Restrictions

Alex Kouzemtchenko|arXiv (Cornell University)|Jun 23, 2018
Adversarial Robustness in Machine Learning参考文献 6被引用 4
一句话总结

本文提出通过施加非负权重约束来训练恶意软件分类神经网络,以抵御操纵Android恶意软件布尔特征的对抗性扰动。通过强制实施硬性非负权重或N1/N2正则化,模型对能够欺骗分类器的基于梯度的攻击完全具备抵抗力,采用硬性约束时实现0%误分类率,且优于包括防御蒸馏在内的基线方法。

ABSTRACT

There is a growing body of literature showing that deep neural networks are vulnerable to adversarial input modification. Recently this work has been extended from image classification to malware classification over boolean features. In this paper we present several new methods for training restricted networks in this specific domain that are highly effective at preventing adversarial perturbations. We start with a fully adversarially resistant neural network that has hard non-negative weight restrictions and is equivalent to learning a monotonic boolean function and then attempt to relax the constraints to improve classifier accuracy.

研究动机与目标

  • 解决深度神经网络在恶意软件分类中对通过操纵布尔特征使恶意软件被误判为良性之对抗性扰动的脆弱性。
  • 探究非负权重约束是否能使恶意软件分类器对基于梯度的对抗性攻击完全具备抵抗力。
  • 通过放松硬性约束的正则化技术,评估对抗性鲁棒性与分类准确率之间的权衡。
  • 对比非负权重约束与现有防御方法(如防御蒸馏)的有效性,后者可能依赖梯度遮蔽而非真正的鲁棒性。

提出的方法

  • 在DREBIN数据集上,使用硬性非负权重约束训练一个具有ReLU激活函数和50%丢弃率的全连接深度神经网络,以强制实现布尔特征学习的单调性。
  • 实现N1和N2正则化惩罚项,分别通过仅对负权重值应用L1和L2范数来惩罚负权重。
  • 通过将惩罚项应用于激活前的求和值或激活值本身,探索正则化位置的替代方案,以防止小负权重产生大的负向贡献。
  • 采用非负权重初始化(Glorot正态分布的绝对值)以加速收敛并提升训练稳定性。
  • 通过启用仅基于清单的二进制特征来模仿Grosse等人提出的对抗性攻击方法,利用基于梯度的特征选择策略来欺骗分类器。
  • 使用误分类率(MR)、假负率(FNR)和假正率(FPR)等指标评估防御效果,比较硬性约束、正则化与蒸馏方法。

实验结果

研究问题

  • RQ1硬性非负权重约束是否能完全防止在布尔特征上训练的恶意软件分类网络中的对抗性扰动?
  • RQ2与硬性约束相比,N1/N2正则化在保持高分类准确率的同时,能在多大程度上提升鲁棒性?
  • RQ3与标准权重正则化相比,将正则化放置于激活值或激活前求和值上是否能增强对抗性鲁棒性?
  • RQ4防御蒸馏与非负权重约束相比,在抵抗对抗性攻击方面表现如何?其成功是源于真正的鲁棒性,还是梯度遮蔽?
  • RQ5尽管被限制无法学习非单调布尔规则,非负权重网络是否仍能实现高准确率?

主要发现

  • 硬性非负权重约束网络实现了0%误分类率、6.29% FNR和0.75% FPR,优于所有其他方法,包括蒸馏方法。
  • 0.67 N1正则化模型表现劣于硬性约束网络,误分类率为18.86%,FNR为11.15%,FPR为1.71%,表明软性正则化效果较差。
  • N2正则化未带来有意义的鲁棒性提升,表明对负权重施加L2惩罚不足以实现鲁棒性。
  • 将正则化应用于激活值或激活前求和值的替代位置并未改善性能,表明问题根源在于权重值本身。
  • 在高温下(如100)的防御蒸馏方法表现出较低的误分类率(3.4%),但发现其依赖梯度遮蔽,因为当在蒸馏模型上测试时,95.3%的对抗性样本仍被错误分类。
  • 硬性约束网络等价于学习单调布尔函数,提示未来可探索利用单调性实现鲁棒恶意软件检测。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。