Skip to main content
QUICK REVIEW

[论文解读] Contextual Weisfeiler-Lehman Graph Kernel For Malware Detection

A. Sankara Narayanan, Guozhu Meng|arXiv (Cornell University)|Jun 21, 2016
Advanced Malware Detection Techniques参考文献 10被引用 10
一句话总结

本文提出了一种上下文感知的Weisfeiler-Lehman图核(CWLK),这是一种新型图核,能够捕捉程序表示图(PRGs)中的结构邻域信息与可达性上下文,从而提升恶意软件检测性能。CWLK在F-measure上分别比最先进的图核和恶意软件检测技术高出5.27%和4.87%,同时保持线性时间效率,适用于大规模Android应用分析。

ABSTRACT

In this paper, we propose a novel graph kernel specifically to address a challenging problem in the field of cyber-security, namely, malware detection. Previous research has revealed the following: (1) Graph representations of programs are ideally suited for malware detection as they are robust against several attacks, (2) Besides capturing topological neighbourhoods (i.e., structural information) from these graphs it is important to capture the context under which the neighbourhoods are reachable to accurately detect malicious neighbourhoods. We observe that state-of-the-art graph kernels, such as Weisfeiler-Lehman kernel (WLK) capture the structural information well but fail to capture contextual information. To address this, we develop the Contextual Weisfeiler-Lehman kernel (CWLK) which is capable of capturing both these types of information. We show that for the malware detection problem, CWLK is more expressive and hence more accurate than WLK while maintaining comparable efficiency. Through our large-scale experiments with more than 50,000 real-world Android apps, we demonstrate that CWLK outperforms two state-of-the-art graph kernels (including WLK) and three malware detection techniques by more than 5.27% and 4.87% F-measure, respectively, while maintaining high efficiency. This high accuracy and efficiency make CWLK suitable for large-scale real-world malware detection.

研究动机与目标

  • 解决现有图核在捕捉可达性上下文方面的局限性——这对检测恶意程序行为至关重要,而不仅仅是结构邻域信息。
  • 通过整合程序表示图(PRGs)中的领域特定上下文信息,提升图核在恶意软件检测中的表达能力。
  • 开发一种在显著提升检测准确率的同时保持高效率的图核,超越最先进的图核和恶意软件检测技术。
  • 证明上下文感知图表示在检测能够规避基于语法和仅基于结构的检测方法的恶意软件变种方面的优越性。

提出的方法

  • 通过改进顶点标签方案,将可达性上下文信息融入Weisfeiler-Lehman(WL)核,基于局部结构和路径上下文传播标签。
  • 引入一种上下文感知的标签处理过程,追踪从根节点出发的路径上标签的序列,使核能够区分结构相似但上下文不同的邻域。
  • 设计CWLK为正定核,通过比较其迭代优化后的标签分布来计算PRGs之间的相似性,同时保留拓扑与上下文信息。
  • 通过核显式表示PRGs的特征向量,支持与SVM等核化分类器的兼容性,实现可扩展的恶意软件检测。
  • 优化核计算过程,使其相对于PRG密度呈线性时间复杂度,确保在大规模应用分析中的可扩展性。
  • 使用ICFG(跨过程控制流图)表示,并设置深度限制h=2作为实证评估的主要PRG模型。

实验结果

研究问题

  • RQ1一种能够同时捕捉结构邻域及其可达性上下文的图核,是否能显著提升相比现有图核的恶意软件检测准确率?
  • RQ2在PRGs中引入上下文信息如何影响基于图的恶意软件检测模型的表达能力与性能?
  • RQ3所提出的CWLK核是否在保持高效率的同时,于大规模真实世界恶意软件数据集上实现卓越的准确率?
  • RQ4PRGs中的上下文信息在多大程度上有助于检测能够规避基于语法和仅基于结构的检测方法的恶意软件变种?

主要发现

  • CWLK在超过50,000个真实世界Android应用的数据集上实现了95.82%(±0.66)的F-measure,比最先进的Drebin方法高出4.87%的F-measure。
  • CWLK在F-measure上比Weisfeiler-Lehman核(WLK)高出5.27%,证明了上下文信息在提升检测准确率方面的价值。
  • 该方法在PRG密度上保持线性时间复杂度,尽管其表达能力增强,仍可实现大规模恶意软件检测的可扩展性。
  • CWLK实现了97.15%(±0.28)的精确率和94.53%(±0.75)的召回率,在所有对比方法中均表现最优。
  • 效率对比显示,CWLK与其它基于PRG的方法(如Allix等人)相当,且显著快于Adagio等重量级方法,但略慢于非PRG基的轻量级方法。
  • 结果证实,在PRGs中同时捕捉结构与上下文特征可带来更优的检测性能,验证了可达性上下文是识别恶意行为的关键信号这一假设。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。