[论文解读] Adversarial Attacks on Transformers-Based Malware Detectors
本文通过应用快速梯度符号法(FGSM)生成扰动的恶意软件样本,研究了基于Transformer的恶意软件检测器的对抗性漏洞,实现了23.9%的误分类率。通过对抗性训练和特征空间缩减提出防御方法,分别将误分类率降低至11.2%和21.5%,表明最先进模型易受逃避攻击的影响。
Signature-based malware detectors have proven to be insufficient as even a small change in malignant executable code can bypass these signature-based detectors. Many machine learning-based models have been proposed to efficiently detect a wide variety of malware. Many of these models are found to be susceptible to adversarial attacks - attacks that work by generating intentionally designed inputs that can force these models to misclassify. Our work aims to explore vulnerabilities in the current state of the art malware detectors to adversarial attacks. We train a Transformers-based malware detector, carry out adversarial attacks resulting in a misclassification rate of 23.9% and propose defenses that reduce this misclassification rate to half. An implementation of our work can be found at https://github.com/yashjakhotiya/Adversarial-Attacks-On-Transformers.
研究动机与目标
- 评估最先进基于Transformer的恶意软件检测器对对抗性攻击的脆弱性。
- 评估各种防御机制在恶意软件检测系统中对抗逃避攻击的有效性。
- 证明即使先进的深度学习模型(如Transformer)也容易受到恶意软件二进制文件中微小、有针对性的扰动影响。
- 为恶意软件检测模型提供对抗性攻击与防御的实用实现。
提出的方法
- 使用反汇编的汇编代码和从PE文件中提取的静态特征,训练了一个基于Transformer的恶意软件检测器。
- 通过在输入特征上添加微小、有针对性的扰动,应用快速梯度符号法(FGSM)生成对抗性样本。
- 使用目标FGSM,以目标类别标签最大化误分类概率。
- 通过在对抗性样本上重新训练模型,实现对抗性训练,以提高模型鲁棒性。
- 通过减少特征空间,限制可用于扰动的维度数量。
- 通过测量对抗性输入上的最终误分类率,评估防御性能。
实验结果
研究问题
- RQ1对抗性攻击能否成功绕过最先进基于Transformer的恶意软件检测器?
- RQ2FGSM在生成可逃避检测的对抗性恶意软件样本方面效果如何?
- RQ3不同的防御策略——对抗性训练与特征空间缩减——如何影响模型的鲁棒性?
- RQ4减少特征空间在多大程度上能缓解对抗性攻击?
主要发现
- 基于FGSM的对抗性攻击在基于Transformer的恶意软件检测器上实现了23.9%的误分类率。
- 对抗性训练将误分类率降低至11.2%,显著提升了模型鲁棒性。
- 特征空间缩减仅略微提升了鲁棒性,将误分类率降低至21.5%。
- 结果证实,即使先进的深度学习模型(如Transformer)也容易受到通过微小输入扰动实现的逃避攻击。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。