Skip to main content
QUICK REVIEW

[논문 리뷰] Automatic Root Cause Analysis via Large Language Models for Cloud Incidents

Yinfang Chen, Huaibing Xie|arXiv (Cornell University)|2023. 05. 25.
Software System Performance and Reliability인용 수 6
한 줄 요약

이 논문은 루트 코스 분석(RCA)을 자동화하기 위해 LLM 기반 시스템인 RCACopilot을 제안한다. 이 시스템은 로그, 메트릭스, 트레이스 등 다중 소스 진단 데이터를 집계하고, 대규모 언어 모델(LLM)을 활용해 루트 코스 카테고리를 예측하고 설명한다. 실제 마이크로소프트 데이터셋을 대상으로 평가한 결과, RCACopilot은 최대 0.766의 RCA 정확도를 달성하여 현장 대기 엔지니어의 수작업을 크게 줄였다.

ABSTRACT

Ensuring the reliability and availability of cloud services necessitates efficient root cause analysis (RCA) for cloud incidents. Traditional RCA methods, which rely on manual investigations of data sources such as logs and traces, are often laborious, error-prone, and challenging for on-call engineers. In this paper, we introduce RCACopilot, an innovative on-call system empowered by the large language model for automating RCA of cloud incidents. RCACopilot matches incoming incidents to corresponding incident handlers based on their alert types, aggregates the critical runtime diagnostic information, predicts the incident's root cause category, and provides an explanatory narrative. We evaluate RCACopilot using a real-world dataset consisting of a year's worth of incidents from Microsoft. Our evaluation demonstrates that RCACopilot achieves RCA accuracy up to 0.766. Furthermore, the diagnostic information collection component of RCACopilot has been successfully in use at Microsoft for over four years.

연구 동기 및 목표

  • 복잡한 클라우드 시스템에서 수작업 RCA가 시간이 오래 걸리고 오류가 발생하기 쉬운 문제를 해결하기 위해.
  • 로그, 메트릭스, 트레이스에서 온라인 대기 엔지니어가 수집하고 해석하는 진단 데이터의 수집과 해석을 자동화하여 인지 부담을 줄이기 위해.
  • 대규모 언어 모델(LLM)을 활용해 루트 코스 예측 및 설명을 통해 RCA 정확도와 속도를 향상시키기 위해.
  • 사전 정의된 인시던트 핸들러와 LLM 기반 진단을 통해 확장 가능하고 일반화된 인시던트 대응을 가능하게 하기 위해.
  • 진단 데이터 수집과 LLM 기반 RCA를 하나의 생산업무용 시스템으로 통합하여 실제 클라우드 환경에 적용 가능하게 하기 위해.

제안 방법

  • RCACopilot는 엔지니어가 정의한 논리 모듈인 인시던트 핸들러를 사용하여 들어오는 경고를 적절한 현장 대기 팀에 매칭하고 진단 데이터 수집을 시작한다.
  • 경고 유형과 시스템 컨텍스트에 기반해 로그, 메트릭스, 트레이스에서 핵심 런타임 진단 정보를 집계한다.
  • 수집된 진단 데이터를 처리하기 위해 대규모 언어 모델(LLM)을 활용하며, 체인 오브 써포트 추론을 사용해 루트 코스 카테고리를 예측한다.
  • 예측된 루트 코스에 대한 설명적 내러티브를 생성하여 투명성을 높이고 엔지니어의 이해를 돕는다.
  • 진단 데이터 수집 컴포넌트는 마이크로소프트에서 네 번째 해가 넘도록 생산 환경에 구현되어 있어 안정성과 확장성을 입증했다.
  • 시스템은 마이크로소프트 클라우드 서비스에서 1년 치의 실제 인시던트 데이터셋을 사용해 평가되었다.
Figure 2 . Recurring incidents proportion vs. time interval.
Figure 2 . Recurring incidents proportion vs. time interval.

실험 결과

연구 질문

  • RQ1집계된 다중 소스 진단 데이터를 기반으로 LLM 기반 시스템이 클라우드 인시던트의 루트 코스 카테고리를 효과적으로 예측할 수 있는가?
  • RQ2실제 생산 환경에서 LLM 기반 RCA의 정확도는 전통적인 수작업 방법보다 어떻게 비교되는가?
  • RQ3사전 정의된 인시던트 핸들러가 진단 데이터 수집의 일관성과 효율성에 어느 정도 기여하는가?
  • RQ4시스템은 다양한 인시던트 유형과 클라우드 서비스 워크로드에 대해 얼마나 잘 일반화되는가?
  • RQ5LLM이 생성한 설명은 현장 대기 엔지니어의 의사결정과 인시던트 해결 속도에 어떤 영향을 미치는가?

주요 결과

  • RCACopilot는 마이크로소프트 클라우드 인시던트의 실제 데이터셋에서 최대 0.766의 루트 코스 분석 정확도를 달성했다.
  • RCACopilot의 진단 정보 수집 컴포넌트는 마이크로소프트에서 네 해 이상 생산 환경에서 사용되어 오랜 기간 안정성과 신뢰성을 입증했다.
  • 시스템은 경고 유형과 인시던트 컨텍스트에 기반해 로그, 메트릭스, 트레이스를 자동으로 집계함으로써 수작업을 크게 줄였다.
  • LLM 기반 루트 코스 예측 단계는 체인 오브 써포트 추론을 활용해 해석 가능한 설명을 생성하여 투명성과 신뢰도를 향상시켰다.
  • 감시 시스템이 인시던트를 탐지하지 못하거나 특정 경고 유형에 대응하는 핸들러가 존재하지 않는 경우, 시스템의 성능이 제한된다.
  • LLM의 불안정성에도 불구하고 평가 결과는 일관된 성능을 보였으며, 철저한 코드 검증을 통해 구현 편향을 완화했다.
Figure 3 . Distribution of incident category frequency.
Figure 3 . Distribution of incident category frequency.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.