Skip to main content
QUICK REVIEW

[논문 리뷰] Transparently Capturing Request Execution Path for Anomaly Detection

Yong Yang, Long Wang|arXiv (Cornell University)|2020. 01. 20.
Software System Performance and Reliability참고 문헌 24인용 수 5
한 줄 요약

이 논문은 분산 클라우드 및 빅데이터 시스템에서 종단 간 요청 실행 경로를 캡처하기 위한 투명하고 저비용의 방법인 REPTrace를 제안한다. 다양한 실행 시나리오를 분석하고 체계적인 추적 알고리즘을 적용함으로써, REPTrace는 96%의 재현율을 달성하며 최소한의 지연과 무시할 만한 네트워크 오버헤드로 네 가지 생산 환경 기반 플랫폼에서 정확한 이상 탐지 기능을 제공한다.

ABSTRACT

With the increasing scale and complexity of cloud systems and big data analytics platforms, it is becoming more and more challenging to understand and diagnose the processing of a service request in such distributed platforms. One way that helps to deal with this problem is to capture the complete end-to-end execution path of service requests among all involved components accurately. This paper presents REPTrace, a generic methodology for capturing such execution paths in a transparent fashion. We analyze a comprehensive list of execution scenarios, and propose principles and algorithms for generating the end-to-end request execution path for all the scenarios. Moreover, this paper presents an anomaly detection approach exploiting request execution paths to detect anomalies of the execution during request processing. The experiments on four popular distributed platforms with different workloads show that REPTrace can transparently capture the accurate request execution path with reasonable latency and negligible network overhead. Fault injection experiments show that execution anomalies are detected with high recall (96%).

연구 동기 및 목표

  • 대규모이고 복잡한 분산 시스템에서 서비스 요청 처리를 진단하는 데 증가하는 도전 과제를 해결하기 위해.
  • 분산 플랫폼의 모든 구성 요소를 통해 종단 간 요청 실행 경로를 정확하게 추적할 수 있도록 하기 위해.
  • 최소한의 성능 오버헤드를 유발하는 투명한 추적 메커니즘을 개발하기 위해.
  • 요청 실행 경로를 분석하여 실행 이면을 탐지하기 위해.
  • 다양한 분산 플랫폼과 워크로드에서 접근 방식을 검증하기 위해.

제안 방법

  • REPTrace는 분산 시스템의 모든 구성 요소를 통해 완전한 요청 실행 경로를 캡처하기 위한 일반적인 방법론을 활용한다.
  • 분기, 루프, 동시 처리를 포함한 다양한 실행 시나리오를 다룰 수 있도록 원칙과 알고리즘을 정의한다.
  • 응용 프로그램 로직을 수정하지 않으면서도 추적의 정확성을 유지하기 위해 경량 인스트루멘테이션과 컨텍스트 전파를 사용한다.
  • 네트워크 및 CPU 오버헤드를 최소화하기 위해 최적화된 데이터 수집 및 집계 기법을 활용하는 분산 추적 기술을 활용한다.
  • 통계적 및 패턴 기반 모델을 사용하여 캡처된 실행 경로의 이탈을 분석함으로써 이상 탐지를 수행한다.
  • 기존 서비스나 구성 요소에 대한 변경 사항이 필요 없도록 설계되어 있어 투명성을 확보한다.

실험 결과

연구 질문

  • RQ1복잡한 분산 시스템에서 종단 간 요청 실행 경로를 정확하고 투명하게 캡처할 수 있는 방법은 무엇인가요?
  • RQ2다양한 구성 요소를 통해 다양한 실행 시나리오를 다루기 위해 필요한 원칙과 알고리즘은 무엇인가요?
  • RQ3요청 실행 경로를 효과적으로 활용하여 높은 재현율로 런타임 이상을 탐지할 수 있나요?
  • RQ4실제 분산 플랫폼에서 제안된 추적 메커니즘의 성능 오버헤드는 어느 정도인가요?
  • RQ5장애 주입 및 다양한 워크로드 조건에서 이상 탐지 메커니즘의 성능은 어떻게 되나요?

주요 결과

  • REPTrace는 네 가지 인기 있는 분산 플랫폼에서 네트워크 및 CPU 오버헤드가 무시할 만큼 낮은 수준으로 정확한 종단 간 요청 실행 경로를 캡처하는 데 성공했다.
  • 낮은 지연 시간을 기록하여 실시간 환경에서의 생산 배포에 적합하다.
  • 장애 주입 실험을 통해 캡처된 경로를 활용해 이상을 탐지하는 데 96%의 재현율을 달성했다.
  • 기존 서비스나 구성 요소에 대한 수정 없이도 투명하게 작동한다.
  • 클라우드 및 빅데이터 플랫폼을 포함한 다양한 워크로드와 시스템 아키텍처에 잘 일반화된다.
  • 이상 탐지 메커니즘이 실행 흐름의 이질성을 효과적으로 식별하여 조기 장애 진단을 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.