Skip to main content
QUICK REVIEW

[논문 리뷰] LogMaster: Mining Event Correlations in Logs of Large scale Cluster Systems

Rui Ren, Xiaoyu Fu|arXiv (Cornell University)|2010. 03. 04.
Data Mining Algorithms and Applications인용 수 10
한 줄 요약

LogMaster는 실세계 Hadoop 및 HPC 워크로드에서 노드, 애플리케이션, 유형, 심각도 속성 간의 복잡한 종속성을 모델링하여 대규모 클러스터 시스템 로그에서 이벤트 상관관계를 채굴하기 위한 새로운 시스템을 제안한다. 이 시스템은 이벤트 상관관계 그래프(이하 ECG)와 고유한 상관관계 측정 지표를 사용하여 순서가 어긋나거나 교차하여 발생하는 이벤트를 탐지함으로써 고장 이벤트에 대해 최대 94.5%의 예측 정확도를 달성한다.

ABSTRACT

This paper presents a methodology and a system, named LogMaster, for mining correlations of events that have multiple attributions, i.e., node ID, application ID, event type, and event severity, in logs of large-scale cluster systems. Different from traditional transactional data, e.g., supermarket purchases, system logs have their unique characteristic, and hence we propose several innovative approaches to mine their correlations. We present a simple metrics to measure correlations of events that may happen interleavedly. On the basis of the measurement of correlations, we propose two approaches to mine event correlations; meanwhile, we propose an innovative abstraction: event correlation graphs (ECGs) to represent event correlations, and present an ECGs based algorithm for predicting events. For two system logs of a production Hadoop-based cloud computing system at Research Institution of China Mobile and a production HPC cluster system at Los Alamos National Lab (LANL), we evaluate our approaches in three scenarios: (a) predicting all events on the basis of both failure and non-failure events; (b) predicting only failure events on the basis of both failure and non-failure events; (c) predicting failure events after removing non-failure events.

연구 동기 및 목표

  • 기존의 거래 기반 상관관계 방법으로는 포착되지 않는 복잡하고 교차하는 이벤트 상관관계를 탐지하는 데 도전하는 것.
  • 노드 ID, 애플리케이션 ID, 이벤트 유형, 심각도 등의 다중 속성을 가진 시스템 로그를 구조화된 이벤트 시퀀스로 모델링하여 상관관계 채굴을 수행하는 것.
  • 고장 이벤트와 비고장 이벤트를 모두 입력으로 사용하여 고장을 사전에 식별할 수 있는 예측 시스템을 개발하는 것.
  • 실제 생산 환경의 Hadoop 및 HPC 클러스터에서 시스템을 평가하여 다양한 클러스터 환경에서의 효과성을 검증하는 것.

제안 방법

  • 이벤트가 순서대로 발생하지 않거나 교차하여 발생할 수 있는 상황에서도 상관관계를 정량화할 수 있는 새로운 상관관계 측정 지표를 제안한다.
  • 이벤트 간의 종속성과 시간적 관계를 표현하기 위해 상관관계 그래프(이하 ECG)를 구조적 추상화로 도입한다.
  • 그래프 구조와 이벤트 속성을 활용하여 향후 발생할 만한 이벤트를 추론하는 ECG 기반 예측 알고리즘을 설계한다.
  • 대규모 로그 스트림을 효율적으로 처리하고 변화하는 패턴을 탐지하기 위해 슬라이딩 윈도우 메커니즘을 적용한다.
  • 빈도와 동시 발생 패턴을 기반으로 높은 상관관계를 가진 이벤트 쌍을 우선순위 정렬하기 위해 ECG에 가중치 기반 스코어 함수를 사용한다.
  • 고속도 로그 데이터에서 노이즈와 의미 있는 상관관계를 구분하기 위해 임계값 기반 필터링 전략을 적용한다.

실험 결과

연구 질문

  • RQ1이벤트가 교차하거나 다중 속성을 지닌 채로 순서가 어긋나는 경우 대규모 클러스터 로그에서 이벤트 상관관계를 효과적으로 측정하는 방법은 무엇인가?
  • RQ2이벤트 상관관계 그래프(이하 ECG)는 다양한 노드와 애플리케이션 간의 복잡한 종속성을 정확하게 표현할 수 있는가?
  • RQ3ECG 기반 예측 모델은 고장 이벤트와 비고장 이벤트를 모두 입력으로 사용할 때 고장을 발생하기 전에 얼마나 정확하게 탐지할 수 있는가?
  • RQ4실제 Hadoop 및 HPC 클러스터의 생산 환경에서 로그 볼륨이 다양하거나 다양한 시스템 조건이 적용될 경우 시스템의 성능은 어떻게 되는가?

주요 결과

  • 제안된 상관관계 측정 지표는 이벤트가 로그 순서상 비연속적이거나 교차하여 발생하더라도 의미 있는 이벤트 관계를 성공적으로 식별한다.
  • 이벤트 상관관계 그래프(이하 ECG)는 노드, 애플리케이션, 이벤트 유형 간의 다중 속성 기반 복잡한 종속성을 효과적으로 모델링한다.
  • 고장 이벤트와 비고장 이벤트를 모두 포함한 전체 로그 환경에서, Hadoop 기반 클라우드 시스템에서 고장 이벤트의 예측 정확도가 94.5%에 도달했다.
  • 비고장 이벤트를 제거한 경우, LANL의 HPC 클러스터에서 고장 이벤트의 예측 정확도는 96.7%로 상승하여 신호 대 노이즈 비율이 향상됨을 확인했다.
  • 이 방법은 클라우드 컴퓨팅 시스템과 고성능 컴퓨팅 클러스터라는 두 가지 상이한 생산 환경 모두에서 뛰어난 성능을 보였다.
  • ECG 기반 예측 모델은 고장을 발생하기 전에 고장을 탐지하는 데 있어 기준 대비 방법보다 뚜렷이 뛰어난 성능을 보이며 그래프 추상화의 효과성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.