Skip to main content
QUICK REVIEW

[논문 리뷰] Log-based Anomaly Detection Without Log Parsing

Van-Hoang Le, Hongyu Zhang|arXiv (Cornell University)|2021. 08. 04.
Software System Performance and Reliability참고 문헌 54인용 수 4
한 줄 요약

NeuralLog는 로그 파싱을 생략하고 BERT를 사용해 원시 로그 메시지를 직접 의미 벡터로 인코딩한 다음, 이상 탐지에 Transformer 기반 분류기를 적용하는 로그 기반 이상 탐지 방법을 제안한다. 이는 네 개의 공개 데이터셋에서 F1 점수 0.95 이상을 기록하며, OOV 단어 오류와 의미 오해로 인한 오류를 제거함으로써 기존의 파싱에 의존하는 방법보다 우수한 성능을 보인다.

ABSTRACT

Software systems often record important runtime information in system logs for troubleshooting purposes. There have been many studies that use log data to construct machine learning models for detecting system anomalies. Through our empirical study, we find that existing log-based anomaly detection approaches are significantly affected by log parsing errors that are introduced by 1) OOV (out-of-vocabulary) words, and 2) semantic misunderstandings. The log parsing errors could cause the loss of important information for anomaly detection. To address the limitations of existing methods, we propose NeuralLog, a novel log-based anomaly detection approach that does not require log parsing. NeuralLog extracts the semantic meaning of raw log messages and represents them as semantic vectors. These representation vectors are then used to detect anomalies through a Transformer-based classification model, which can capture the contextual information from log sequences. Our experimental results show that the proposed approach can effectively understand the semantic meaning of log messages and achieve accurate anomaly detection results. Overall, NeuralLog achieves F1-scores greater than 0.95 on four public datasets, outperforming the existing approaches.

연구 동기 및 목표

  • 로그 파싱 오류—특히 OOV 단어와 의미 오해로 인한 영향이 이상 탐지 성능에 미치는 부정적 영향을 조사하는 것.
  • 로그 파싱에 의존하지 않고도 의미의 무결성을 유지하고 파싱으로 인한 정보 손실을 방지할 수 있는 로그 기반 이상 탐지 방법을 개발하는 것.
  • BERT와 같은 사전 훈련된 언어 모델을 활용해 원시 로그 메시지에서 직접 문맥적이고 의미적인 표현을 추출하는 것.
  • 사전 이벤트 템플릿 없이 의미 기반 로그 시퀀스를 기반으로 이상을 탐지할 수 있는 시퀀스 인식 분류 모델을 설계하는 것.
  • 실제 로그 데이터셋에서 제안된 방법을 검증하고, 파싱 기반 최신 기술 대비 뛰어난 성능을 입증하는 것.

제안 방법

  • 원시 로그 메시지를 밀도 있는 의미 벡터로 인코딩하기 위해 WordPiece 토크나이제이션을 사용한 BERT를 활용하여 OOV 단어를 처리하되, 로그 파싱이 필요 없도록 한다.
  • 각 원시 로그 메시지를 토큰의 시퀀스로 간주하고, 사전 훈련된 BERT 모델을 적용해 의미를 유지하는 문맥 기반 임베딩을 추출한다.
  • 고정 또는 슬라이딩 윈도우를 통해 시간적으로 메시지를 그룹화하여 이상 탐지 모델의 입력 시퀀스로 구성한다.
  • 장거리 의존성과 로그 시퀀스 간의 문맥적 관계를 모델링하기 위해 다중 헤드 자기주의를 활용한 Transformer 기반 분류기를 사용한다.
  • 레이블이 부여된 로그 시퀀스를 사용해 지도 학습 방식으로 종합적인 모델을 훈련하며, 의미 표현에서 학습된 패tern 기반으로 이상을 식별한다.
  • 모든 형태의 로그 템플릿 추출이나 이벤트 인덱싱을 회피함으로써 파싱 오류를 제거하고 전체 의미적 맥락을 유지한다.
Figure 1: An Example of HDFS Logs and Parsed Results
Figure 1: An Example of HDFS Logs and Parsed Results

실험 결과

연구 질문

  • RQ1로그 파싱 중 OOV 단어와 의미 오해로 인한 오류가 기존 로그 기반 이상 탐지 방법의 성능에 얼마나 심각한 영향을 미치는가?
  • RQ2로그 파싱 없이도 원시 로그 메시지를 직접 처리하는 딥 러닝 모델이 파싱에 의존하는 방법보다 더 뛰어난 이상 탐지 성능을 달성할 수 있는가?
  • RQ3BERT 기반 의미 인코딩이 이상 탐지에 적합한 로그 메시지의 문맥적 및 의미적 의미를 얼마나 잘 유지할 수 있는가?
  • RQ4원시 로그 임베딩 기반으로 훈련된 Transformer 기반 분류기가 파싱된 로그 이벤트에 의존하는 모델보다 이상 탐지에서 더 우수한 성능을 내는가?
  • RQ5제안된 방법이 보조 데이터나 수동 템플릿 설계 없이 다양한 실세계 로그 데이터셋에 일반화 가능한가?

주요 결과

  • 실험 분석을 통해 로그 파싱 오류—특히 OOV 단어와 의미 오해로 인한 오류가 기존 이상 탐지 모델의 성능을 심각하게 떨어뜨리는 것으로 확인되었다.
  • NeuralLog는 네 개의 공개 벤치마크 데이터셋에서 모두 F1 점수 0.95 초과를 기록하여, 로그 파싱 없이도 높은 탐지 정확도를 확보했다.
  • LogRobust, LogAnomaly, DeepLog 등 파싱 기반 최신 기술에 비해 성능이 뛰어나며, 이러한 방법들은 파싱 정확도에 민감하게 반응하는 것으로 나타났다.
  • BERT를 사용해 원시 로그를 인코딩함으로써, 희귀하거나 미리 보지 못한 OOV 용어에 대해서도 의미적 의미와 문맥적 관계를 효과적으로 포착할 수 있었다.
  • 의미 벡터 기반으로 종합적인 모델을 훈련함으로써, 로그 템플릿 추출이나 외부 데이터가 필요 없이 강력한 이상 탐지 성능을 달성했다.
  • 파싱 과정을 회피하고 사전 훈련된 언어 표현을 직접 활용함으로써 계산 비용이 높은 파싱 단계를 피함으로써 효율적이고 확장 가능한 방법이었다.
Figure 2: An Example of Log Sequence, and Log Count Vector
Figure 2: An Example of Log Sequence, and Log Count Vector

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.