Skip to main content
QUICK REVIEW

[논문 리뷰] Pinpointing Anomaly Events in Logs from Stability Testing -- N-Grams vs. Deep-Learning

Mika Mäntylä, Martı́n Varela|arXiv (Cornell University)|2022. 02. 18.
Software System Performance and Reliability인용 수 4
한 줄 요약

이 논문은 안정성 테스트에서 이상 로그 이벤트를 이상성 수준으로 평가하기 위해 N-gram 모델과 LSTM 기반 딥러닝 모델을 제안하고 비교한다. 정상 로그 시퀀스만으로 훈련된 N-gram 모델은 LSTM에 비해 거의 유사한 정확도를 달성한다 (HDFS에서 0.904 대 0.900; Android 로그에서 0.848 대 0.865), 그러나 계산 효율성이 크게 뛰어나 (4–13초 대 16분에서 거의 4시간), 산업 현장에서 로그 루트 케이스 분석에 더 유리한 선택이 된다.

ABSTRACT

As stability testing execution logs can be very long, software engineers need help in locating anomalous events. We develop and evaluate two models for scoring individual log-events for anomalousness, namely an N-Gram model and a Deep Learning model with LSTM (Long short-term memory). Both are trained on normal log sequences only. We evaluate the models with long log sequences of Android stability testing in our company case and with short log sequences from HDFS (Hadoop Distributed File System) public dataset. We evaluate next event prediction accuracy and computational efficiency. The LSTM model is more accurate in stability testing logs (0.848 vs 0.865), whereas in HDFS logs the N-Gram is slightly more accurate (0.904 vs 0.900). The N-Gram model has far superior computational efficiency compared to the Deep model (4 to 13 seconds vs 16 minutes to nearly 4 hours), making it the preferred choice for our case company. Scoring individual log events for anomalousness seems like a good aid for root cause analysis of failing test cases, and our case company plans to add it to its online services. Despite the recent surge in using deep learning in software system anomaly detection, we found limited benefits in doing so. However, future work should consider whether our finding holds with different LSTM-model hyper-parameters, other datasets, and with other deep-learning approaches that promise better accuracy and computational efficiency than LSTM based models.

연구 동기 및 목표

  • 장기간 지속되는 안정성 테스트에서 고장이 점진적으로 발생하고 재현이 어려운 상황에서 이상 로그 이벤트를 식별하는 데 도전 과제를 해결하기 위해.
  • 딥러닝이 소프트웨어 신뢰성 테스트를 위한 로그 이상 탐지에서 전통적인 N-gram 모델보다 유의미한 이점을 제공하는지 평가하기 위해.
  • 엔지니어가 의심스러운 로그 항목을 강조할 수 있도록 이벤트 수준의 이상성 점수를 제공하여 루트 케이스 분석을 지원하기 위해.
  • 대규모 로그 데이터 처리에 있어 산업적 제약 조건을 고려해 정확도와 함께 계산 효율성을 우선시하기 위해.

제안 방법

  • 정상 로그 시퀀스만으로 N-gram 및 LSTM 모델을 훈련하여 맥락 기반 패턴을 학습한다.
  • 이전 맥락을 기반으로 각 로그 이벤트의 가능도를 평가하여 이벤트를 점수화한다: 가능도가 낮을수록 이상성이 높다.
  • N-gram 빈도 수를 사용하여 이전 n-1개 이벤트를 바탕으로 다음 이벤트의 가능도를 추정한다.
  • 장기 기억 순환 신경망(LSTM)을 사용하여 순차적 의존성을 모델링하고 시퀀스의 다음 이벤트를 예측한다.
  • 이상성 탐지 성능의 대체 지표로 다음 이벤트 예측 정확도를 적용한다.
  • 루트 케이스 조사 지원을 위해 점수화된 로그 시퀀스를 활용해 이상 이벤트를 시각화한다.

실험 결과

연구 질문

  • RQ1RQ1: 이상 로그 이벤트 탐지에서 N-gram과 LSTM 중 어떤 모델이 더 우수한 성능을 보이는가?
  • RQ2RQ2: 로그 시퀀스의 이상 탐지에 최적의 N-gram 구성(예: n값)은 무엇인가?
  • RQ3RQ3: 두 데이터셋을 모두 고려할 때, 어떤 모델이 모든 구성에서 더 높은 종합 정확도를 제공하는가?
  • RQ4RQ4: 디버깅 목적을 위해 개별 이벤트의 이상성은 어떻게 효과적으로 측정하고 시각화할 수 있는가?

주요 결과

  • N-gram 모델은 HDFS 데이터셋에서 다음 이벤트 예측 정확도가 LSTM 모델보다 略적으로 높았다 (0.904 대 0.900).
  • LSTM 모델은 Android 안정성 테스트 로그에서 다음 이벤트 예측 정확도가 N-gram 모델보다 略적으로 높았다 (0.865 대 0.848).
  • N-gram 모델은 LSTM 모델에 비해 계산 효율성이 크게 뛰어나 동일 작업에 대해 4–13초가량 소요된 반면, LSTM은 16분에서 거의 4시간까지 소요되었다.
  • 계산 효율성 격차는 N-gram 모델에 크게 유리하여, 처리 시간이 중요한 산업 현장에서의 구현에 더 적합하다.
  • 최근 이상 탐지 분야에서 딥러닝의 추세가 지속되고 있음에도 불구하고, 본 연구에서는 소프트웨어 로그에 대해 LSTM을 N-gram보다 사용하는 데 실질적인 이점이 거의 없음을 발견했다. 정확도 향상이 미미하고 계산 비용이 매우 높기 때문이다.
  • 이 기업은 이벤트 수준의 이상성 점수 기능을 온라인 안정성 테스트 서비스에 통합할 계획이며, 이는 루트 케이스 분석에서의 가치를 인정하고 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.