Skip to main content
QUICK REVIEW

[논문 리뷰] MicroHECL: High-Efficient Root Cause Localization in Large-Scale Microservice Systems

Dewei Liu, Chuan He|arXiv (Cornell University)|2021. 03. 01.
Software System Performance and Reliability참고 문헌 17인용 수 11
한 줄 요약

MicroHECL는 대규모 마이크로서비스 시스템에서 성능, 신뢰성, 트래픽 이상을 탐지하고, 동적으로 서비스 호출 그래프를 구성하며, 맞춤형 머신러닝 및 통계 모델을 사용하여 루트 코스 로컬라이제이션을 높은 효율로 수행하는 시스템이다. 또한 전파 체인 분석을 가속화하기 위해 정렬 전략을 적용한다. 알리바바의 생산 환경에서 MicroHECL는 루트 코스 로컬라이제이션 시간을 분당 30분에서 5분으로 단축시키며, 상위 3개 정답 비율은 68%를 기록한다.

ABSTRACT

Availability issues of industrial microservice systems (e.g., drop of successfully placed orders and processed transactions) directly affect the running of the business. These issues are usually caused by various types of service anomalies which propagate along service dependencies. Accurate and high-efficient root cause localization is thus a critical challenge for large-scale industrial microservice systems. Existing approaches use service dependency graph based analysis techniques to automatically locate root causes. However, these approaches are limited due to their inaccurate detection of service anomalies and inefficient traversing of service dependency graph. In this paper, we propose a high-efficient root cause localization approach for availability issues of microservice systems, called MicroHECL. Based on a dynamically constructed service call graph, MicroHECL analyzes possible anomaly propagation chains, and ranks candidate root causes based on correlation analysis. We combine machine learning and statistical methods and design customized models for the detection of different types of service anomalies (i.e., performance, reliability, traffic). To improve the efficiency, we adopt a pruning strategy to eliminate irrelevant service calls in anomaly propagation chain analysis. Experimental studies show that MicroHECL significantly outperforms two state-of-the-art baseline approaches in terms of both accuracy and efficiency. MicroHECL has been used in Alibaba and achieves a top-3 hit ratio of 68% with root cause localization time reduced from 30 minutes to 5 minutes.

연구 동기 및 목표

  • 대규모 산업용 마이크로서비스 시스템에서 가용성 문제 발생 시 느리고 정확도가 떨어지는 루트 코스 로컬라이제이션 문제를 해결하기 위해.
  • 복잡한 서비스 종속성 그래프에서 이상 전파 체인 분석의 효율성을 향상시키기 위해.
  • 성능, 신뢰성, 트래픽 이상과 같은 서로 다른 유형의 서비스 이상을 별도로 모델링하여 이상 탐지 정확도를 향상시키기 위해.
  • 관련성이 없는 서비스 호출을 대상으로 하는 정렬 전략을 통해 루트 코스 순위 매기기에서의 잘못된 경고와 불필요한 계산을 줄이기 위해.
  • 알리바바의 전자상거래 플랫폼과 같은 실시간 생산 환경에서 사용 가능한 확장성 있고 구현 가능한 솔루션을 제공하기 위해.

제안 방법

  • 최근 시간 창 내에서 실시간 서비스 종속성과 품질 지표(예: 응답 시간)를 반영하는 동적 서비스 호출 그래프를 구성한다.
  • 성능, 신뢰성, 트래픽 이상을 탐지하기 위해 특화된 머신러닝 및 통계 방법 기반의 세 가지 맞춤형 모델을 활용한다.
  • 초기 이상이 발생한 서비스에서 시작하여 이상 전파 체인을 이끌어내는 이상 서비스 호출을 따라 서비스 호출 그래프를 순회한다.
  • 현재 이상 전파 경로와 통계적으로 관련성이 없는 서비스 호출 간선을 제거하는 정렬 전략을 적용하여 계산 효율성을 향상시킨다.
  • 초기 이상 서비스의 비즈니스 수준 지표와 후보 서비스의 품질 지표 간 상관관계 분 析을 통해 후보 루트 코스를 순위 매긴다.
  • 역사적 및 실시간 지표와 인과 관계를 결합하여 전체 추적 수집 없이도 루트 코스를 추론한다.

실험 결과

연구 질문

  • RQ1수천 개의 서비스를 포함한 대규모 마이크로서비스 시스템에서 루트 코스 로컬라이제이션을 어떻게 더 효율적으로 만들 수 있는가?
  • RQ2성능, 신뢰성, 트래픽 이상과 같은 서로 다른 이상 유형을 구분함으로써 탐지 정확도에 어떤 영향을 미치는가?
  • RQ3통계적 상관관계 기반 정렬 전략이 정확도를 훼손하지 않고도 검색 공간을 상당히 줄일 수 있는가?
  • RQ4머신러닝 및 통계 모델의 통합은 상관관계 기반 방법에 비해 이상 탐지 성능을 어떻게 향상시키는가?
  • RQ5동적 서비스 호출 그래프를 기반으로 한 그래프 기반 전파 분석은 실제 생산 환경의 최신 기술 수준 대비 어떤 정도 뛰어난 성능을 보이는가?

주요 결과

  • MicroHECL은 알리바바의 생산 환경에서 루트 코스 로컬라이제이션 시간을 평균 30분에서 5분으로 단축시켰다.
  • 상위 3개 정답 비율은 68%를 기록하여 최신 기술 수준의 기준인 MonitorRank와 Microscope를 크게 앞서며 성능을 뛰어넘었다.
  • 정렬 전략은 정확도를 떨어뜨리지 않고도 효율성을 향상시켜 대규모이고 복잡한 종속성 그래프에서 더 빠른 분석을 가능하게 하였다.
  • 성능, 신뢰성, 트래픽 이상을 위한 맞춤형 이상 탐지 모델은 일반적인 상관관계 기반 방법에 비해 더 정확한 루트 코스 식별을 가능하게 하였다.
  • 시스템은 알리바바에서 5개월 이상 성공적으로 배포되었으며, 600건 이상의 가용성 장애 사례를 처리했고, 개발자들이 그 제안에 높은 신뢰를 두고 있다.
  • 실험적 평가 결과, MicroHECL는 정확도 및 효율성 측면에서 여러 지표에서 MonitorRank와 Microscope를 모두 뛰어넘었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.