Skip to main content
QUICK REVIEW

[논문 리뷰] Interpreting GNN-based IDS Detections Using Provenance Graph Structural Features

Kunal Mukherjee, Joshua Wiedemeier|arXiv (Cornell University)|2023. 06. 01.
Machine Learning in Materials Science인용 수 4
한 줄 요약

이 논문은 GNN 기반 침입 탐지 시스템(GNN-based IDS)의 투명성을 향상시키기 위해 해석 가능한 그래프 구조적 특징을 사용하여 모델 결정을 설명하는 프레임워크인 ProvExplainer를 제안한다. 결정 트리와 같은 단순하고 해석 가능한 모델을 사용해 GNN 예측을 최대 99%의 정밀도로 모방함으로써, 악성코드 탐지에 대한 인간이 이해할 수 있는 시스템 수준의 설명을 가능하게 하고, 보안 운영에서의 책임감을 제고한다.

ABSTRACT

Advanced cyber threats (e.g., Fileless Malware and Advanced Persistent Threat (APT)) have driven the adoption of provenance-based security solutions. These solutions employ Machine Learning (ML) models for behavioral modeling and critical security tasks such as malware and anomaly detection. However, the opacity of ML-based security models limits their broader adoption, as the lack of transparency in their decision-making processes restricts explainability and verifiability. We tailored our solution towards Graph Neural Network (GNN)-based security solutions since recent studies employ GNNs to comprehensively digest system provenance graphs for security-critical tasks. To enhance the explainability of GNN-based security models, we introduce PROVEXPLAINER, a framework offering instance-level security-aware explanations using an interpretable surrogate model. PROVEXPLAINER's interpretable feature space consists of discriminant subgraph patterns and graph structural features, which can be directly mapped to the system provenance problem space, making the explanations human interpretable. We show how PROVEXPLAINER synergizes with current state-of-the-art (SOTA) GNN explainers to deliver domain and instance-specific explanations. We measure the explanation quality using the Fidelity+/Fidelity- metric as used by traditional GNN explanation literature, we incorporate the precision/recall metric, where we consider the accuracy of the explanation against the ground truth, and we designed a human actionability metric based on graph traversal distance. On real-world Fileless and APT datasets, PROVEXPLAINER achieves up to 29%/27%/25%/1.4x higher Fidelity+, precision, recall, and actionability (where higher values are better), and 12% lower Fidelity- (where lower values are better) when compared against SOTA GNN explainers.

연구 동기 및 목표

  • 시스템 프로벤ance 분석에서 사용되는 블랙박스 GNN 기반 침입 탐지 시스템(_IDS_)의 투명성 부족과 실행 가능한 설명 부족 문제를 해결한다.
  • 시스템 프로벤ance 그래프에서 인간이 이해할 수 있는 문제 공간의 행동으로 복잡한 GNN 결정 경계를 매핑함으로써, 복잡한 GNN 결정 경계를 해석하는 과제를 극복한다.
  • 보안 도메인 지식에 기반한 해석 가능한 그래프 구조적 특징을 활용해 고정밀도 서rogate 모델링을 가능하게 하는 모델에 종속되지 않는 프레임워크를 개발한다.
  • 실제 시스템 행동과 일치하는 서술적이고 논리적인 설명을 제공함으로써, GNN 기반 탐지에 대한 신뢰도와 책임감을 제고한다.
  • 도메인 전문가가 모델 예측을 관찰 가능한 시스템 수준의 행동과 하위구조 패턴에 연결함으로써, 경고를 더 confidence 있게 검토, 디버깅, 대응할 수 있도록 한다.

제안 방법

  • 고전적 그래프 이론에서 유도된 그래프 구조적 특징과 보안 도메인 통찰을 통합하여, GNN의 결정 경계를 재현하는 서rogate 모델, 특히 결정 트리(DTs)를 훈련한다.
  • 중심성 측정, 군집 계수, 하위구조 패턴 지표와 같은 해석 가능한 그래프 구조적 특징 세트를 설계하여, 알려진 악성 행동(예: 드라이브-바이-다운로드, 프로세스 체인 이상)과 직접적으로 연결한다.
  • 블랙박스 쿼리 메커니즘을 사용해 GNN 모델의 예측을 추출함으로써, 내부 가중치에 접근할 필요 없이 서rogate 모델이 GNN의 결정 경계를 학습할 수 있도록 한다.
  • 시스템 프로벤ance 데이터셋에 대한 데이터 기반 분석을 통해 특징 공학을 최적화하며, 양호한 워크로드 드리프트와 악성 공격에 대한 강건성을 확보한다.
  • 서로 다른 하위구조 설명 기법(예: SubgraphX)과 통합하여, 그래프 내 영향력 있는 하위구조를 강조함으로써 국소적 해석 가능성을 향상시킨다.
  • 자연어로 묘사된 시스템 행동을 그래프 특징으로 매핑하는 행동 쿼리 언어 프로토타입을 개발하여 프로그램 분류 및 이상 탐지에 활용한다.

실험 결과

연구 질문

  • RQ1해석 가능한 그래프 구조적 특징가 복잡한 GNN 기반 IDS 모델의 의사결정 논리를 시스템 프로벤ance 분석에서 효과적으로 포괄할 수 있는가?
  • RQ2엔지니어링된 특징을 사용해 단순하고 해석 가능한 모델인 결정 트리가 GNN 예측을 얼마나 높은 정밀도로 모방할 수 있는가?
  • RQ3결과적으로 생성된 설명들이 보안 분야에서 알려진 실제 시스템 수준의 행동과 악성 행동으로 얼마나 잘 매핑될 수 있는가?
  • RQ4글로벌 서rogate 모델과 하위구조 수준의 설명 기법을 조합함으로써, 프레임워크가 글로벌 및 로컬 해석 가능성을 모두 지원할 수 있는가?
  • RQ5소프트웨어 업데이트나 워크로드 드리프트와 같은 일반적인 시스템 행동의 변화에 대해 설명은 얼마나 강건한가?

주요 결과

  • ProvExplainer는 일반적인 그래프 구조적 특징을 사용해 일반적인 프로그램 분류 작업에서 원본 GNN 모델에 대해 95%의 정밀도를 달성한 결정 트리 서rogate 모델을 가능하게 했다.
  • 악성코드 탐지에 특화된 특징 패키지를 적용한 결과, 서rogate 모델의 정밀도가 99%에 도달하여 GNN의 결정 경계와 높은 일치를 보였다.
  • 세 가족에 속한 다섯 개의 실제 악성코드 샘플에 대한 사례 연구를 통해, ProvExplainer가 생성한 설명이 프로세스 체인, 파일/소켓 상호작용과 같은 악성 하위구조 패턴을 정확히 강조함을 확인했다.
  • 이 프레임워크는 추상적인 GNN 결정을 실제 시스템 수준의 행동, 예를 들어 낮은 프로세스 가까움 중심성과 비영인 소켓 중심성과 같은 구체적이고 인간이 이해할 수 있는 기술로 성공적으로 매핑했다. 이러한 특성들은 악성 행동의 징후로 간주된다.
  • 보안 의미에 기반한 그래프 특징의 사용으로 도메인 전문가가 탐지 결과를 신뢰할 수 있게 해석하고 검증할 수 있었으며, 이는 트리지 및 대응 워크플로우를 향상시켰다.
  • ProvExplainer는 모델에 종속되지 않으며, 어떤 블랙박스 프로벤ance 기반 IDS와도 호환되어, 기반 GNN 모델의 아키텍처에 대한 액세스 없이도 설명 생성이 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.