[论文解读] Robust and Effective Malware Detection through Quantitative Data Flow Graph Metrics
本文提出一种基于定量数据流图(QDFG)的鲁棒恶意软件检测方法,通过系统资源间可度量的数据流建模系统行为。通过应用受社交网络分析启发的图度量,并基于这些特征训练机器学习分类器,该方法实现了98.01%的检测率和0.48%的误报率,相较于n-gram和原始系统调用方法,在应对调用重排和注入等行为混淆技术时表现出更优的鲁棒性。
We present a novel malware detection approach based on metrics over quantitative data flow graphs. Quantitative data flow graphs (QDFGs) model process behavior by interpreting issued system calls as aggregations of quantifiable data flows.Due to the high abstraction level we consider QDFG metric based detection more robust against typical behavior obfuscation like bogus call injection or call reordering than other common behavioral models that base on raw system calls. We support this claim with experiments on obfuscated malware logs and demonstrate the superior obfuscation robustness in comparison to detection using n-grams. Our evaluations on a large and diverse data set consisting of about 7000 malware and 500 goodware samples show an average detection rate of 98.01% and a false positive rate of 0.48%. Moreover, we show that our approach is able to detect new malware (i.e. samples from malware families not included in the training set) and that the consideration of quantities in itself significantly improves detection precision.
研究动机与目标
- 解决传统基于签名和行为的检测技术难以应对的混淆恶意软件检测挑战。
- 提升对调用重排和虚假系统调用注入等常见混淆技术的检测鲁棒性。
- 通过将定量数据流信息整合到基于图的行为模型中,提高检测精度。
- 通过灵活的度量基准建模,实现对未知恶意软件家族(零日检测)的检测。
- 开发一种可扩展且高效的替代方案,以替代子图同构和污点追踪方法在恶意软件检测中的应用。
提出的方法
- 使用定量数据流图(QDFG)建模系统行为,将系统调用解释为实体(如进程、文件、套接字)之间的量化数据流。
- 通过在时间区间内聚合系统调用事件构建QDFG,以带标签的有向边表示数据传输,并为节点和边赋予数据量和类型等属性。
- 对进程节点计算图度量(如度中心性、介数中心性、特征向量中心性),以捕捉行为特征。
- 将这些度量作为输入特征,训练基于标记良性(goodware)和恶意(malware)进程样本的机器学习分类器。
- 通过基于度量的轮廓分析实现近似相似性比较,而非精确模式匹配,从而提升对行为混淆的鲁棒性。
- 利用QDFG的高层抽象能力,在无需事先了解其行为的情况下检测未知恶意软件家族。
实验结果
研究问题
- RQ1与原始系统调用序列相比,定量数据流图度量是否能提升检测精度和对行为混淆的鲁棒性?
- RQ2QDFG度量在多大程度上能够检测出训练数据中未出现过的恶意软件样本?
- RQ3在图建模中引入数据量(如传输字节数)对误报率和漏报率有何影响?
- RQ4与基于n-gram和子图同构的检测技术相比,所提方法在鲁棒性和效率方面表现如何?
- RQ5基于度量的QDFG分析是否在检测效果和对混淆的鲁棒性方面优于现有基于图的恶意软件检测方法?
主要发现
- 所提出的基于QDFG的方法在约7,000个恶意软件和500个良性软件样本的数据集上,实现了98.01%的平均检测率和0.48%的误报率。
- 将定量数据流特征整合到模型中,相较于非定量方法,使误报率和漏报率均降低约一半。
- 由于数据流数量的抽象化,该方法在应对调用重排和虚假系统调用注入等常见混淆技术时表现出更优的鲁棒性。
- 该方法成功检测出此前未见过的恶意软件家族样本,表明其具备强大的泛化能力,超越已知恶意软件模式。
- 与n-gram方法相比,基于度量的QDFG方法在混淆抗性方面表现更优,因为n-gram对调用序列变化敏感。
- 采用图度量而非精确子图匹配,实现了高效且可扩展的检测,无需依赖昂贵的同构性检查。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。