[论文解读] Static Malware Detection & Subterfuge: Quantifying the Robustness of Machine Learning and Current Anti-Virus
本文提出了一种新颖的黑箱对抗性测试方法,以定量评估机器学习(ML)和传统杀毒(AV)系统在静态恶意软件检测器面前对逃避攻击的鲁棒性。通过应用非破坏性二进制修改、打包、混淆和代码注入,作者表明,由于能够从二进制中分散的特征中泛化,基于ML的模型(n-gram和MalConv)对逃避攻击的鲁棒性显著优于AV产品,尽管它们仍易受复杂混淆和新型攻击类型的威胁。
As machine-learning (ML) based systems for malware detection become more prevalent, it becomes necessary to quantify the benefits compared to the more traditional anti-virus (AV) systems widely used today. It is not practical to build an agreed upon test set to benchmark malware detection systems on pure classification performance. Instead we tackle the problem by creating a new testing methodology, where we evaluate the change in performance on a set of known benign & malicious files as adversarial modifications are performed. The change in performance combined with the evasion techniques then quantifies a system's robustness against that approach. Through these experiments we are able to show in a quantifiable way how purely ML based systems can be more robust than AV products at detecting malware that attempts evasion through modification, but may be slower to adapt in the face of significantly novel attacks.
研究动机与目标
- 为解决缺乏标准化基准以比较恶意软件检测系统的问题,提出一种新的评估方法。
- 量化基于ML的恶意软件检测器与商用AV产品在已知逃避技术下的鲁棒性。
- 探究当面对恶意软件二进制文件的对抗性修改时,ML模型是否比基于签名的AV系统具有更好的泛化能力。
- 探索当前逃避技术的局限性,并评估ML模型在检测新型或混淆恶意软件时的泛化能力。
提出的方法
- 基于Biggio等人提出的对手模型,开发一个基于黑箱对抗性测试框架,定义目标、知识和能力。
- 应用四种逃避技术:非破坏性二进制修改、对抗性遮蔽(随机字节掩码)、使用UPX打包,以及ROP注入。
- 使用两种ML模型:一种简单的n-gram模型和一种基于原始字节序列训练的深度学习模型(MalConv)。
- 采用测试协议,评估模型在对抗性修改前后对已知良性和恶意文件的性能,以衡量性能下降。
- 通过每种逃避技术下的性能下降程度来衡量鲁棒性,并在多种攻击类型下比较ML模型与AV产品的表现。
- 使用字节级遮蔽技术探测特征重要性,并推断ML模型为何更具鲁棒性——归因于其在二进制中分布式的特征使用。
实验结果
研究问题
- RQ1基于ML的恶意软件检测器在抵抗非破坏性二进制修改方面,与商用AV产品相比表现如何?
- RQ2对抗性遮蔽攻击在多大程度上揭示了ML模型与AV系统在特征依赖性上的差异?
- RQ3打包和代码注入技术(如ROP注入)能否成功逃避基于ML和基于AV的检测器?它们之间的表现如何比较?
- RQ4ML模型的鲁棒性是否源于其在二进制中分布式的特征使用,如遮蔽测试所暗示的那样?
- RQ5用于测试鲁棒性的逃避技术是否可被重新用于恶意软件检测训练中的数据增强?
主要发现
- 在非破坏性二进制修改下,基于ML的模型(n-gram和MalConv)表现出显著高于商用AV产品的鲁棒性,性能下降极小。
- 对抗性遮蔽测试表明,ML模型依赖于二进制中广泛分布的特征,因此对局部变化的敏感性低于AV系统,后者依赖于特定的、局部的签名。
- 商用AV产品极易被简单修改(如修改几个字节或导入随机函数)所绕过,表明其决策边界脆弱。
- 使用UPX打包和ROP注入对所有系统构成持续挑战,但ML模型在检测注入的恶意代码方面比AV系统表现出更强的韧性。
- 研究表明,在对抗性样本(如ROP注入的二进制文件)上进行训练,可能提升对特定攻击的检测能力,但可能损害对真正新型恶意软件变种的泛化能力。
- 所提出的黑箱对抗性测试框架具有领域无关性,可适配其他文件格式(如PDF)或操作系统(如Linux、iOS),从而实现对静态分析系统更广泛的评估。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。