[논문 리뷰] LAnoBERT: System Log Anomaly Detection based on BERT Masked Language Model
LAnoBERT는 로그 파서에 의존하지 않고, BERT의 마스킹 언어 모델링(MLM)을 사용하여 정상 로그 패턴을 학습하는 파서 프리, 비지도 학습 기반의 시스템 로그 이상 탐지 방법을 제안한다. 이는 HDFS, BGL, Thunderbird 데이터셋에서 최신 기술 수준의 성능을 달성하며, 비지도 모델을 능가하고 지도 학습 기준과도 맞먹는 성능을 보이며, 실시간 구현에 적합한 효율적인 추론을 가능하게 한다.
The system log generated in a computer system refers to large-scale data that are collected simultaneously and used as the basic data for determining errors, intrusion and abnormal behaviors. The aim of system log anomaly detection is to promptly identify anomalies while minimizing human intervention, which is a critical problem in the industry. Previous studies performed anomaly detection through algorithms after converting various forms of log data into a standardized template using a parser. Particularly, a template corresponding to a specific event should be defined in advance for all the log data using which the information within the log key may get lost. In this study, we propose LAnoBERT, a parser free system log anomaly detection method that uses the BERT model, exhibiting excellent natural language processing performance. The proposed method, LAnoBERT, learns the model through masked language modeling, which is a BERT-based pre-training method, and proceeds with unsupervised learning-based anomaly detection using the masked language modeling loss function per log key during the test process. In addition, we also propose an efficient inference process to establish a practically applicable pipeline to the actual system. Experiments on three well-known log datasets, i.e., HDFS, BGL, and Thunderbird, show that not only did LAnoBERT yield a higher anomaly detection performance compared to unsupervised learning-based benchmark models, but also it resulted in a comparable performance with supervised learning-based benchmark models.
연구 동기 및 목표
- 로그 파서에 의존하는 기존 이상 탐지 방법의 한계를 해결하기 위해 정보 손실 위험과 전문가가 설정한 템플릿에 의존하는 문제를 해결하고자 한다.
- 로그 파서를 통한 사전 처리 없이 원시 로그 시퀀스에서 직접 정상 로그 패턴을 학습하는 강력한 비지도 이상 탐지 프레임워크를 개발하고자 한다.
- BERT의 컨텍스트 기반 임베딩을 로그 데이터에 대해 미세조정한 마스킹 언어 모델링을 활용하여 이상 탐지 성능을 향상시키고자 한다.
- 실시간 시스템 모니터링에 적합한 효율적인 추론 파이프라인을 통해 실용적 구현을 가능하게 하고자 한다.
- 자연어 유사한 구조를 가진 다양한 복잡도의 로그 데이터에서 사전 학습된 BERT의 효과를 탐색하고자 한다.
제안 방법
- LAnoBERT는 마스킹 언어 모델링(MLM)을 사용해 로그 시퀀스에서부터 완전히 새로 사전 학습한 BERT 기반 아키텍처를 사용하여 정상 로그 패턴의 컨텍스트 표현을 학습한다.
- 모델은 정규식 기반 사전 처리와 WordPiece 토크나이제이션을 통해 원시 로그 키를 처리하여 로그 파서 의존성을 회피한다.
- 추론 과정에서 이상 점수는 MLM의 예측 손실과 상위-k 예측 확률에 기반하여 계산되며, 높은 손실은 이상성을 나타낸다.
- 이상은 예측 토큰 확률이 정상 패턴에서 벗어난 정도를 측정하여 상위-k 확률 점수의 임계값을 기준으로 탐지한다.
- 모델은 시퀀스 임베딩 캐싱과 어텐션 패턴 재사용을 통해 효율적인 추론을 지원하여 실시간 배포가 가능하도록 한다.
- 모델은 MLM 목표를 통해 로그 데이터에 대해 미세조정되며, 학습에 정상 로그만을 사용하는 비지도 설정에서 성능을 평가한다.

실험 결과
연구 질문
- RQ1마스킹 언어 모델링을 통해 훈련된 BERT 기반 모델이 로그 파서 없이도 시스템 로그 이상을 효과적으로 탐지할 수 있는가?
- RQ2LAnoBERT의 성능은 표준 벤치마크 데이터셋에서 비지도 및 지도 학습 기반의 기존 기준 모델과 비교해 어떻게 되는가?
- RQ3자연어 코퍼스에서 사전 학습한 BERT가, 최소한의 어휘 집합과 단순한 구조를 가진 로그 데이터에서 이상 탐지 성능에 유리한지 또는 악영향을 미치는가?
- RQ4비지도, 파서 프리 접근 방식이 실세계의 로그 이상 탐지 시나리오에서 지도 학습 기반 모델과 비슷한 성능을 달성할 수 있는가?
- RQ5생산 환경에서 BERT 기반 이상 탐지의 실용성을 높이기 위해 어떻게 효율적인 추론 파이프라인을 설계할 수 있는가?
주요 결과
- LAnoBERT는 HDFS, BGL, Thunderbird 데이터셋에서 모든 비지도 기준 모델을 능가하며, 각각 최고의 F1 스코어를 기록했다.
- BGL 데이터셋에서 사전 학습된 BERT 모델을 사용할 경우 F1 스코어가 0.9020을 기록했으며, 초기 학습에서 0.0271 향상된 성능을 보였다.
- HDFS 데이터셋에서 초기 학습으로 미세조정한 결과 F1 스코어가 0.9304를 기록했으며, 사전 학습된 BERT 버전보다 0.0341 높은 성능을 보였다. 이는 매우 단순한 로그 구조에서는 사전 학습이 성능에 악영향을 줄 수 있음을 시사한다.
- 결과는 사전 학습된 BERT가 로그 데이터에 충분한 언어적 복잡도(예: 1,000개 이상의 어휘)가 포함된 경우(예: BGL)에만 유익하며, HDFS와 같은 최소 구조 데이터셋에서는 효과가 없다는 것을 시사한다.
- LAnoBERT는 지도 학습 기반 모델과 비교해 유사한 성능을 달성했으며, 이는 MLM을 통한 비지도 사전 학습이 이상 탐지에서 지도 학습 방법과 견줄 만한 성능을 낼 수 있음을 보여준다.
- 제안된 효율적인 추론 파이프라인은 실시간 배포를 가능하게 하여 모델을 실용적인 시스템 모니터링에 적합하게 한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.