[논문 리뷰] Constructing Large-Scale Real-World Benchmark Datasets for AIOps
이 논문은 주요 기업의 생산 환경에서 수집한 실세계 대규모 AIOps 벤치마크 데이터셋 세 종류를 소개한다. 이는 KPI 이상 탐지, 다차원 데이터에서의 원인 진단, 장애 진단을 위한 것으로, 연간 경쟁 대회에서 수백 명의 참가자가 참여한 바 있다. 이 데이터셋은 실제 장애를 주입한 정확한 레이블을 포함하고 있어 표준화된 평가와 AIOps 연구의 발전을 가능하게 하며, 현실적이고 대규모이며 공개 가능한 데이터를 제공한다.
Recently, AIOps (Artificial Intelligence for IT Operations) has been well studied in academia and industry to enable automated and effective software service management. Plenty of efforts have been dedicated to AIOps, including anomaly detection, root cause localization, incident management, etc. However, most existing works are evaluated on private datasets, so their generality and real performance cannot be guaranteed. The lack of public large-scale real-world datasets has prevented researchers and engineers from enhancing the development of AIOps. To tackle this dilemma, in this work, we introduce three public real-world, large-scale datasets about AIOps, mainly aiming at KPI anomaly detection, root cause localization on multi-dimensional data, and failure discovery and diagnosis. More importantly, we held three competitions in 2018/2019/2020 based on these datasets, attracting thousands of teams to participate. In the future, we will continue to publish more datasets and hold competitions to promote the development of AIOps further.
연구 동기 및 목표
- AIOps 연구를 위한 공개적이고 대규모이며 실세계 데이터셋의 부족으로 인해 제안된 방법의 공정한 비교와 실제 적용 가능성에 한계가 존재함을 해결하기 위해.
- KPI 이상 탐지, 다차원 원인 진단, 장애 진단 등 다양한 AIOps 시나리오를 포함하는 포괄적인 벤치마크 데이터셋을 제공하기 위해.
- 학계와 산업계 소속 팀이 참가하는 연간 AIOps 알고리즘 경쟁 대회를 통해 공동 연구 및 개발을 촉진하기 위해.
- 실제 생산 환경과 유사한 데이터와 알려진 원인을 가진 장애 주입을 통해 AIOps 기법의 재현 가능하고 표준화된 평가를 가능하게 하기 위해.
- 지속적인 신규 데이터셋 발표와 경쟁 범위 확대를 통해 AIOps의 장기적 성장을 지원하기 위해.
제안 방법
- 騰訊, 이베이, 중화이통 저저우 지점 등의 산업 파트너 기업의 생산 시스템에서 수집한 실세계 모니터링 데이터(트레이스, KPI, 메트릭스 포함)의 수집.
- CPU 스트레스, 네트워크 지연, 데이터베이스 포트 종료 등 7종류의 장애 유형(예: CPU 스트레스, 네트워크 지연, 데이터베이스 포트 종료)에 걸쳐 총 169개의 통제된 장애 주입을 통해 원인을 알 수 있는 장애 이벤트 생성.
- 세 가지 별도의 데이터셋 설계: KPI 이상 탐지용, 트레이스와 메트릭스를 활용한 다차원 원인 진단용, 종합적인 장애 탐지 및 진단용.
- OpenTracing 사양을 따르는 표준화된 데이터 포맷을 통해 분산된 컴포넌트 간 추적성과 인과관계 모델링 보장.
- 온라인 이상 탐지 및 진단 과제를 포함한 경쟁 프레임워크 구현. 참가 팀은 시간 대비 진단 속도와 F-0.5 스코어 기반 순위로 원인 예측 제출.
- 데이터셋과 경쟁 결과(최고 성능 솔루션 포함)의 공개를 통해 AIOps 연구의 투명성과 재현 가능성을 증진.
실험 결과
연구 질문
- RQ1공개된 대규모 실세계 데이터셋은 사적 또는 합성 데이터셋 대비 AIOps 모델의 일반화 능력과 신뢰도를 향상시키는가?
- RQ2공개 벤치마크는 이상 탐지 및 원인 진단 등 다양한 시나리오에서 AIOps 알고리즘의 공정하고 표준화된 평가를 어느 정도 가능하게 하는가?
- RQ3기계학습 모델은 실시간 생산 환경과 유사한 환경에서 주입된 장애를 얼마나 효과적으로 탐지하고 진단하는가?
- RQ4공개 경쟁 대회와 공유된 데이터셋은 AIOps 연구 분야의 공동체 참여와 혁신에 어떤 영향을 미치는가?
- RQ5다차원 데이터(트레이스, KPI, 메트릭스)는 복잡한 분산 시스템에서 원인 진단 정확도 향상에 효과적으로 활용될 수 있는가?
주요 결과
- KPI 이상 탐지, 다차원 원인 진단, 장애 진단을 위한 세 가지 데이터셋은 Cai 등(2021), Yu 등(2021), Li 등(2021)의 연구 작업에서 이미 활용된 바 있다.
- 2020년 AIOps 챌린지에는 총 141개 팀, 517명의 참가자가 참여하여 AIOps 벤치마크 분야에서 높은 공동체 참여도를 보였다.
- 최고 성능 팀은 129개의 장애 중 755점(만점 1290점)을 기록했으며, 유효한 원인 예측에서 정밀도 ≥0.5를 확보했다.
- 정확한 원인 레이블이 주입된 장애를 통해 실세계 장애 데이터의 원인을 알 수 없는 희소성 문제를 해결하고, 장애 진단 시스템의 신뢰성 있는 평가가 가능했다.
- 데이터셋과 경쟁 대회 덕분에 AIOps 연구는 공통의 표준화되고 현실적인 평가 플랫폼을 확보하여 크게 발전했다.
- 저자들은 데이터셋이 다양한 장애 유형과 다수의 컴포넌트 및 서비스에서의 현실적인 모니터링 데이터를 포함하고 있어 실제 생산 환경을 잘 반영하고 있음을 확인했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.