Skip to main content
QUICK REVIEW

[论文解读] Interpreting GNN-based IDS Detections Using Provenance Graph Structural Features

Kunal Mukherjee, Joshua Wiedemeier|arXiv (Cornell University)|Jun 1, 2023
Machine Learning in Materials Science被引用 4
一句话总结

该论文提出ProvExplainer,一种通过使用可解释的图结构特征来增强基于GNN的入侵检测系统(IDS)透明度的框架。它训练简单、可解释的模型(如决策树)以模仿GNN预测,最高可达99%的保真度,从而实现人类可读的、系统级别的恶意软件检测解释,提升安全运营中的可问责性。

ABSTRACT

Advanced cyber threats (e.g., Fileless Malware and Advanced Persistent Threat (APT)) have driven the adoption of provenance-based security solutions. These solutions employ Machine Learning (ML) models for behavioral modeling and critical security tasks such as malware and anomaly detection. However, the opacity of ML-based security models limits their broader adoption, as the lack of transparency in their decision-making processes restricts explainability and verifiability. We tailored our solution towards Graph Neural Network (GNN)-based security solutions since recent studies employ GNNs to comprehensively digest system provenance graphs for security-critical tasks. To enhance the explainability of GNN-based security models, we introduce PROVEXPLAINER, a framework offering instance-level security-aware explanations using an interpretable surrogate model. PROVEXPLAINER's interpretable feature space consists of discriminant subgraph patterns and graph structural features, which can be directly mapped to the system provenance problem space, making the explanations human interpretable. We show how PROVEXPLAINER synergizes with current state-of-the-art (SOTA) GNN explainers to deliver domain and instance-specific explanations. We measure the explanation quality using the Fidelity+/Fidelity- metric as used by traditional GNN explanation literature, we incorporate the precision/recall metric, where we consider the accuracy of the explanation against the ground truth, and we designed a human actionability metric based on graph traversal distance. On real-world Fileless and APT datasets, PROVEXPLAINER achieves up to 29%/27%/25%/1.4x higher Fidelity+, precision, recall, and actionability (where higher values are better), and 12% lower Fidelity- (where lower values are better) when compared against SOTA GNN explainers.

研究动机与目标

  • 解决在系统执行证明分析中使用的黑箱GNN-based入侵检测系统(IDS)缺乏透明度和可操作解释的问题。
  • 通过将复杂的GNN决策边界映射到系统执行证明图中人类可理解的问题空间行为,克服解释复杂GNN决策边界的挑战。
  • 开发一种模型无关的框架,利用基于安全领域知识的可解释图结构特征,实现高保真度的替代模型。
  • 通过提供与真实系统行为一致的描述性、逻辑性解释,提升安全系统中的信任度和可问责性。
  • 通过将模型预测与可观察的系统级行为及子图模式关联,使领域专家能够以信心验证、调试并响应警报。

提出的方法

  • 使用基于经典图论并结合安全领域洞察的图结构特征,训练决策树(DTs)等替代模型,以复制GNN的决策边界。
  • 设计一组可解释的图结构特征,如中心性度量、聚类系数和子图模式指标,这些特征可直接对应已知的恶意行为(如自动下载、进程链异常)。
  • 使用黑箱查询机制提取GNN模型的预测结果,使替代模型能够在不访问其内部权重的情况下学习GNN的决策边界。
  • 通过系统执行证明数据集的数据驱动分析优化特征工程,重点关注对良性工作负载漂移和对抗性操纵具有鲁棒性的特征。
  • 将替代解释与子图解释技术(如SubgraphX)集成,通过突出图中影响显著的子结构来增强局部可解释性。
  • 开发一种行为查询语言原型,将自然语言描述的系统行为映射为图特征,用于程序分类和异常检测。

实验结果

研究问题

  • RQ1可解释的图结构特征是否能有效捕捉复杂GNN-based IDS模型在系统执行证明分析中的决策逻辑?
  • RQ2使用这些工程化特征,简单且可解释的模型(如决策树)在模仿GNN预测方面能达到多高的保真度?
  • RQ3生成的解释在多大程度上能与现实世界中的系统级行为及已知的恶意行为相对应?
  • RQ4通过结合全局替代模型与子图级别的解释技术,该框架是否能同时支持全局和局部可解释性?
  • RQ5解释对良性系统行为变化(如软件更新或工作负载漂移)的鲁棒性如何?

主要发现

  • ProvExplainer 使决策树替代模型在使用通用图结构特征进行通用程序分类任务时,对原始GNN模型的保真度达到95%。
  • 针对恶意软件检测任务定制的特征包使替代模型的保真度提升至99%,表明其与GNN决策边界的高度一致。
  • 对三个家族的五个真实恶意软件样本的案例研究证实,ProvExplainer生成的解释准确地突出了恶意子图模式,如进程链和文件/套接字交互。
  • 该框架成功将抽象的GNN决策映射为具体的、人类可读的系统级行为描述,如低进程接近度中心性与非零套接字度中心性,这些特征是恶意行为的指示。
  • 基于安全语义的图特征使领域专家能够自信地解释和验证检测结果,从而改善了警报筛选与响应工作流。
  • ProvExplainer 是模型无关的,适用于任何黑箱基于执行证明的IDS,无需访问底层GNN模型的架构即可生成解释。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。