Skip to main content
QUICK REVIEW

[논문 리뷰] Artificial Intelligence for IT Operations (AIOPS) Workshop White Paper

Jasmin Bogatinovski, Sasho Nedelkoski|arXiv (Cornell University)|2021. 01. 15.
Software System Performance and Reliability참고 문헌 28인용 수 9
한 줄 요약

이 화이트페이퍼는 인공지능을 통한 IT 운영(AIOPS)의 현황을 종합하여, 고장 관리—특히 이상 탐지, 원인 분석 및 고장 예측—을 주요 연구 초점으로 규명한다. 통합된 분류 체계를 제안하고, 인과 그래프 및 피어드 학습과 같은 핵심 기법을 강조하며, 자율적 IT 운영으로의 진전을 가속화하기 위해 공공 벤치마크 도입을 촉구한다.

ABSTRACT

Artificial Intelligence for IT Operations (AIOps) is an emerging interdisciplinary field arising in the intersection between the research areas of machine learning, big data, streaming analytics, and the management of IT operations. AIOps, as a field, is a candidate to produce the future standard for IT operation management. To that end, AIOps has several challenges. First, it needs to combine separate research branches from other research fields like software reliability engineering. Second, novel modelling techniques are needed to understand the dynamics of different systems. Furthermore, it requires to lay out the basis for assessing: time horizons and uncertainty for imminent SLA violations, the early detection of emerging problems, autonomous remediation, decision making, support of various optimization objectives. Moreover, a good understanding and interpretability of these aiding models are important for building trust between the employed tools and the domain experts. Finally, all this will result in faster adoption of AIOps, further increase the interest in this research field and contribute to bridging the gap towards fully-autonomous operating IT systems. The main aim of the AIOPS workshop is to bring together researchers from both academia and industry to present their experiences, results, and work in progress in this field. The workshop aims to strengthen the community and unite it towards the goal of joining the efforts for solving the main challenges the field is currently facing. A consensus and adoption of the principles of openness and reproducibility will boost the research in this emerging area significantly.

연구 동기 및 목표

  • 기계 학습, 대용량 데이터, IT 운영을 융합하는 새로운 다학제적 분야인 AIOPS를 통합하고 체계화하기 위해.
  • 모델의 해석 가능성, 불확실성 평가, 자율 복구와 같은 AIOPS의 核심 과제를 규명하기 위해.
  • 혁신을 가속화하기 위해 공동 연구자들이 개방적이고 재현 가능한 연구 관행을 널리 채택하도록 촉진하기 위해.
  • AIOPS 기법 간의 상호 비교를 가능하게 하고 연구 진전을 추적하기 위해 공통의 벤치마킹 프레임워크를 구축하기 위해.
  • 향상된 원인 분석 및 자가 치유 시스템을 통해 완전히 자율적인 IT 운영으로 나아가기 위해.

제안 방법

  • 1,000편 이상의 AIOPS 논문을 체계적으로 분석하여 연구 분야를 매크로 영역, 카테고리 및 시간적 추세별로 분류하였다.
  • AIOPS 응용의 분류 체계를 제안하였으며, 고장 관리가 주요 카테고리로 부각되었고, 이는 고장 탐지, 예측, 원인 분석, 복구로 추가로 세분화되었다.
  • 알림 간 인과 관계를 추론하고 원인 알림을 식별하기 위해 하크스 과정 및 그래프 노드 임베딩과 같은 인과 모델링 기법을 적용하였다.
  • 딥 러닝과 서비스 종속성 그래프를 활용하여 클라우드 마이크로서비스에서 성능 저하 원인을 높은 정밀도(0.92)로 탐지하였다.
  • 원시 로그 데이터나 모델 파라미터를 노출하지 않고도 이상 탐지 모델을 공유하기 위해 교사-학생 정렬 기반의 분산형 피어드 학습 접근법을 개발하였다.
  • 공용 클라우드 환경에서 자원 공유를 최적화하면서도 사용자 경험(QoE)을 유지하기 위해 인공 군집 지능 프레임워크를 도입하였다.

실험 결과

연구 질문

  • RQ1AIOPS의 응용 분야와 연구 추세는 시간과 영역에 따라 어떻게 변화하고 있는가?
  • RQ2인과 추론과 그래프 기반 모델링은 복잡한 IT 시스템에서 원인 분석을 어떻게 향상시킬 수 있는가?
  • RQ3신뢰성 있고 해석 가능하며 자율적인 AI 기반 IT 운영을 달성하기 위한 주요 과제는 무엇인가?
  • RQ4민감한 데이터를 노출하지 않고도 IT 서비스 간에 개인정보 보호 지향 지식 공유를 어떻게 실현할 수 있는가?
  • RQ5공공 벤치마크는 AIOPS 연구의 공정한 비교와 진전 가속화에 어떤 역할을 할 수 있는가?

주요 결과

  • 고장 관리는 AIOPS 논문의 62.1%를 차지하며, 고장 탐지(33.7%)와 원인 분석(26.7%)이 가장 활발한 하위 분야이다.
  • 최근 몇 년간 고장 탐지 분야의 연구가 급격히 증가했으며, 2018–2019년 동안 71篇의 논문이 발표되어 전체 자원 할당 카테고리(69편)를 초월하였다.
  • 서비스 종속성 그래프와 메트릭 이상 현상 데이터를 활용한 딥 러닝 기반 마이크로서비스 성능 진단 기법이 원인을 특정하는 데 정밀도 0.92를 달성하였다.
  • 피어드 학습 접근법은 학습 데이터나 모델 파라미터를 공유하지 않으면서도 로그 기반 이상 탐지 성능을 향상시켜 개인정보 보호를 유지하였다.
  • 인공 군집 지능 모델은 고객 간 클라우드 자원 할당을 효과적으로 균형 잡아, 피크 부하 시 QoE를 유지하면서도 활용도를 최소화하는 데 성공하였다.
  • growing 관심에도 불구하고, AIOPS 기법 간 상호 비교를 위한 공공 벤치마크가 아직 존재하지 않아 연구의 진전과 재현 가능성에 장애가 되고 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.