[论文解读] Detecting Malicious Code by Exploiting Dependencies of System-call Groups
本文提出了一种基于图的恶意软件检测技术,通过从系统调用依赖图(ScD)派生的组依赖图(GrD)来建模系统调用行为。通过应用一种新颖的NP相似性度量方法,该方法结合了跨恶意软件家族的定性、定量和关系特征,实现了91.3%的检测率与13.7%的误报率,其准确性和对变形变异的鲁棒性优于或匹配了多种最先进的方法。
In this paper we present an elaborated graph-based algorithmic technique for efficient malware detection. More precisely, we utilize the system-call dependency graphs (or, for short ScD graphs), obtained by capturing taint analysis traces and a set of various similarity metrics in order to detect whether an unknown test sample is a malicious or a benign one. For the sake of generalization, we decide to empower our model against strong mutations by applying our detection technique on a weighted directed graph resulting from ScD graph after grouping disjoint subsets of its vertices. Additionally, we have developed a similarity metric, which we call NP-similarity, that combines qualitative, quantitative, and relational characteristics that are spread among the members of known malware families to archives a clear distinction between graph-representations of malware and the ones of benign software. Finally, we evaluate our detection model and compare our results against the results achieved by a variety of techniques proving the potentials of our model.
研究动机与目标
- 为解决通过结构变化规避签名检测的变形恶意软件检测挑战,利用行为相似性进行检测。
- 通过在组级别而非单个系统调用级别建模系统调用依赖关系,提高对强代码变异的检测鲁棒性。
- 开发一种NP相似性度量方法,整合已知恶意软件家族之间的定性、定量和关系特征,以有效区分良性软件。
- 使用标准化数据集,评估该模型与现有基于图和非基于图的检测技术的性能表现。
提出的方法
- 从程序执行的污点分析追踪中构建系统调用依赖图(ScD)。
- 将系统调用顶点的不相交子集分组,形成加权有向图,称为组依赖图(GrD)。
- 设计NP相似性度量方法,综合整合跨恶意软件家族成员的定性(行为模式)、定量(频率与分布)和关系(依赖结构)特征。
- 采用基于阈值的分类方法,利用NP相似性判断测试样本是否为恶意或良性。
- 在包含2,630个来自48个家族的恶意软件样本和33个良性程序的数据集上执行5折交叉验证,以评估检测性能。
实验结果
研究问题
- RQ1在组级别建模系统调用行为是否能提高对变形恶意软件变异的检测鲁棒性?
- RQ2结合的相似性度量(NP相似性)在基于系统调用组行为特征的基础上,能否有效区分恶意软件与良性软件?
- RQ3所提出的基于GrD的检测模型在性能上与现有基于图和非基于图的恶意软件检测技术相比如何?
- RQ4该模型在多样化恶意软件家族中,能否在保持高检测率的同时最大限度减少误报?
主要发现
- 该模型在包含2,630个来自48个家族的恶意软件样本和33个良性程序的数据集上,实现了91.3%的检测率与13.7%的误报率。
- 在最优参数设置(t=0.96, λ=0.56)下,该模型的检测率与Fredrikson等人[11]的方法相当,但误报率仅高出0.03%。
- 该模型在检测准确率和误报控制方面,优于或匹配了多种最先进的技术,包括基于n-gram、API序列和k-可测试树自动机的方法。
- 该模型对强代码变异表现出强大的抗性,这体现在其能够通过系统调用组依赖关系中的一致行为模式检测出变形变种。
- 通过5折交叉验证的评估显示性能稳定,即使与在同一数据集上使用2折交叉验证的模型相比,该模型仍保持竞争力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。