Skip to main content
QUICK REVIEW

[논문 리뷰] Hierarchical Graph Neural Networks for Causal Discovery and Root Cause Localization

Dongjie Wang, Zhengzhang Chen|arXiv (Cornell University)|2023. 02. 03.
Advanced Graph Neural Networks인용 수 6
한 줄 요약

이 논문은 계층적 그래프 신경망을 사용하여 상호의존 시스템 네트워크 내에서 내부 수준 및 상하위 수준의 인과 관계를 발견하는 새로운 프레임워크인 REASON을 제안한다. 이는 정확한 루트 코스 로컬라이제이션을 가능하게 한다. 무작위 보행을 통한 위상적 장애 전파 추적과 극단가 이론을 활용한 개별 이상 탐지 방식을 융합함으로써, REASON은 실제 데이터셋에서 기존 방법들을 능가한다.

ABSTRACT

In this paper, we propose REASON, a novel framework that enables the automatic discovery of both intra-level (i.e., within-network) and inter-level (i.e., across-network) causal relationships for root cause localization. REASON consists of Topological Causal Discovery and Individual Causal Discovery. The Topological Causal Discovery component aims to model the fault propagation in order to trace back to the root causes. To achieve this, we propose novel hierarchical graph neural networks to construct interdependent causal networks by modeling both intra-level and inter-level non-linear causal relations. Based on the learned interdependent causal networks, we then leverage random walks with restarts to model the network propagation of a system fault. The Individual Causal Discovery component focuses on capturing abrupt change patterns of a single system entity. This component examines the temporal patterns of each entity's metric data (i.e., time series), and estimates its likelihood of being a root cause based on the Extreme Value theory. Combining the topological and individual causal scores, the top K system entities are identified as root causes. Extensive experiments on three real-world datasets with case studies demonstrate the effectiveness and superiority of the proposed framework.

연구 동기 및 목표

  • 기존의 루트 코스 분석**(RCA)** 방법이 고립된 인과 네트워크만 모델링하여 복수의 시스템 네트워크 간의 상호의존성을 忽略한다는 한계를 해결하기 위해.
  • 복잡한 시스템 내 상호연결된 네트워크 간의 인과 구조를 자동으로 발견할 수 있는 일반적인 RCA 프레임워크를 개발하기 위해.
  • 내부 수준(네트워크 내부) 및 상하위 수준(네트워크 간) 인과 관계를 모델링하여 루트 코스 로컬라이제이션 정확도를 향상시키기 위해.
  • 시간적 이상 탐지와 위상적 장애 전파 추적을 통합하여 강력한 루트 코스 식별을 가능하게 하기 위해.
  • 실제 시스템 장애 사례에서 상호의존 네트워크 구조를 포괄하는 것이 효과적인지 검증하기 위해.

제안 방법

  • REASON는 다수의 상호연결된 시스템 네트워크를 통해 비선형적인 내부 수준 및 상하위 수준 인과 관계를 모델링하기 위해 계층적 그래프 신경망을 활용한다.
  • 위상적 인과 발견 컴포넌트는 계층적 GNN 내 메시지 전파를 통해 상호의존 인과 그래프를 학습하고, 재시작이 있는 무작위 보행을 통해 장애 전파를 시뮬레이션한다.
  • 개별 인과 발견 컴포넌트는 극단가 이론을 적용하여 개별 시스템 엔티티의 시계열 데이터에서 급격한 변화를 탐지하고, 그들이 루트 코스일 가능성의 정도를 추정한다.
  • 위상적 및 개별 컴포넌트로부터 도출된 인과 점수를 융합하여 시스템 엔티티를 순위 매기고, 상위 $K$개의 루트 코스를 식별한다.
  • 프레임워크는 도메인 특화 규칙이나 네트워크 구조에 대한 사전 지식 없이, 다변량 시계열 모니터링 데이터를 엔드 투 엔드로 훈련한다.
  • 상호의존 인과 구조는 시스템 메트릭에서 직접 학습되어, 네트워크 간 장애 전파 경로의 자동 발견이 가능해진다.

실험 결과

연구 질문

  • RQ1통합 프레임워크가 루트 코스 로컬라이제이션을 위해 다수의 상호의존 시스템 네트워크 간의 인과 관계를 효과적으로 발견할 수 있는가?
  • RQ2고립된 네트워크 접근 방식에 비해 상하위 수준 인과 의존성을 모델링할 경우, 루트 코스 로컬라이제이션 정확도는 얼마나 향상되는가?
  • RQ3위상적 장애 전파 패tern과 개별 이상 신호가 함께 루트 코스 식별에 얼마나 기여하는가?
  • RQ4다양한 네트워크 구조와 장애 전파 역학을 가진 실제 시스템 장애 사례에 대해 제안된 방법은 얼마나 강건한가?
  • RQ5계층적 그래프 신경망이 복잡한 시스템 모니터링 데이터에서 비선형적이고 다수 수준의 인과 의존성을 효과적으로 포착할 수 있는가?

주요 결과

  • REASON는 세 개의 실제 데이터셋에서 최신 기술을 능가하며, 루트 코스 로컬라이제이션 정확도가 뛰어나다는 것을 입증했다.
  • 절단 실험 결과, 상호의존 네트워크 구조를 모델링함으로써 루트 코스 탐지 성능에 유의미한 향상이 있음을 확인했다.
  • 위상적 장애 전파 추적과 극단가 이론을 통한 개별 이상 탐지의 융합은 프레임워크의 강건성과 정밀도를 향상시켰다.
  • 실제 시스템 장애 사례 연구에서 REASON은 사슬성 장애 상황에서도 진짜 루트 코스인 'pod Django-search'를 성공적으로 식별했다.
  • 파rameter 분석 결과, 재시작이 있는 무작위 보행 컴포넌트가 계층적 네트워크에서 효과적인 장애 전파 역추적을 위해 핵심적인 역할을 한다는 것이 밝혀졌다.
  • AIOps 데이터셋에서 학습된 상호의존 인과 그래프는 명확히 장애 전파 경로를 나타내며, 빨간 점선은 성공적인 루트 코스 역추적을 나타낸다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.