Skip to main content
QUICK REVIEW

[논문 리뷰] Robust and Transferable Anomaly Detection in Log Data using Pre-Trained Language Models

Harold Ott, Jasmin Bogatinovski|arXiv (Cornell University)|2021. 02. 23.
Software System Performance and Reliability참고 문헌 14인용 수 7
한 줄 요약

이 논문은 사전 훈련된 언어 모델(예: BERT, GPT-2, XL-Net)을 사용하여 의미 기반 로그 벡터 임베딩을 생성함으로써 강건하고 이식 가능한 로그 이상 탐지 프레임워크를 제안한다. 전이 학습과 맥락 인식 표현을 활용함으로써, 소프트웨어 업데이트로 인한 로그 메시지 변경에도 강건하며, 기존 템플릿 기반 접근 방식보다 정확도와 일반화 능력 면에서 뛰어난 성능을 달성한다.

ABSTRACT

Anomalies or failures in large computer systems, such as the cloud, have an impact on a large number of users that communicate, compute, and store information. Therefore, timely and accurate anomaly detection is necessary for reliability, security, safe operation, and mitigation of losses in these increasingly important systems. Recently, the evolution of the software industry opens up several problems that need to be tackled including (1) addressing the software evolution due software upgrades, and (2) solving the cold-start problem, where data from the system of interest is not available. In this paper, we propose a framework for anomaly detection in log data, as a major troubleshooting source of system information. To that end, we utilize pre-trained general-purpose language models to preserve the semantics of log messages and map them into log vector embeddings. The key idea is that these representations for the logs are robust and less invariant to changes in the logs, and therefore, result in a better generalization of the anomaly detection models. We perform several experiments on a cloud dataset evaluating different language models for obtaining numerical log representations such as BERT, GPT-2, and XL. The robustness is evaluated by gradually altering log messages, to simulate a change in semantics. Our results show that the proposed approach achieves high performance and robustness, which opens up possibilities for future research in this direction.

연구 동기 및 목표

  • 자주 소프트웨어 업데이트가 이루어지는 대규모 시스템에서 로그 이상 탐지의 과제를 해결하기 위해.
  • 로그 의미 변화나 소프트웨어 업그레이드 상황에서 실패하는 템플릿 기반 및 키워드 매칭 방법의 한계를 극복하기 위해.
  • 사전 훈련된 언어 모델을 활용하여 미리 보지 못한 로그 패턴으로도 일반화할 수 있도록 냉시작 문제를 줄이기 위해.
  • 다양한 사전 훈련된 언어 모델과 학습 목표(회귀 대 비례 분류)가 로그 표현 학습에 얼마나 효과적인지 평가하기 위해.
  • 소프트웨어 업데이트 또는 사전 처리 노이즈로 인한 로그 메시지 변경에도 높은 성능을 유지하는 이식 가능한 프레임워크를 개발하기 위해.

제안 방법

  • 원시 로그 메시지를 밀도 높은 의미 기반 벡터 표현으로 변환하기 위해 일반 목적의 사전 훈련된 언어 모델(BERT, GPT-2, XL-Net)을 활용한다.
  • 학습된 임베딩을 사용하여 순차적이고 맥락적인 의존성을 모델링하기 위해 Bi-LSTM 네트워크를 적용한다.
  • 이상 탐지 모델을 두 가지 학습 목표를 사용하여 훈련한다: (1) 로그 임베딩을 재구성하는 회귀, (2) 정상 및 이상 로그 시퀀스를 구분하는 분류.
  • 소프트웨어 업데이트 후 새로운 로그 분포에 적응하기 위해 이전 로그 데이터로부터의 지식을 재사용하는 모델 전이 전략을 구현한다.
  • 실제 환경 변화를 시뮬레이션하기 위해 로그 메시지를 체계적으로 변경함으로써 데이터 증강을 수행한다(예: 동의어 교체, 재정렬).
  • 정량적 지표(정밀도, 재현율, F1)를 사용하여 로그 메시지 변경 정도와 학습 목표에 따라 성능을 평가한다.

실험 결과

연구 질문

  • RQ1다양한 사전 훈련된 언어 모델(BERT, GPT-2, XL-Net)은 이상 탐지에 효과적인 로그 임베딩을 생성하는 데 어떻게 비교되는가?
  • RQ2로그 진화 상황에서 로그 이상 탐지 성능과 강건성 면에서, 회귀 대비 분류 학습 목표 중 어느 것이 더 우수한가?
  • RQ3소프트웨어 업데이트 또는 로그 메시지 변경 후, 제안된 프레임워크가 얼마나 잘 새로운 로그 패턴으로 일반화되는가?
  • RQ4정밀도, 재현율, F1 스코어 측면에서 로그 메시지 변경 정도가 다양할 경우(예: 15% 의미 변화) 모델은 어떻게 성능을 내는가?
  • RQ5새로운 시스템 버전에서 이전 로그가 없을 경우 냉시작 상황에서 오진을 효과적으로 줄일 수 있는가?

주요 결과

  • BERT는 두 학습 목표 모두에서 GPT-2와 XL-Net를 압도적으로 뛰어넘었으며, 특히 로그 메시지 변경이 심한 상황에서 뛰어난 강건성과 일반화 능력을 보였다.
  • 분류 기반 학습 목표가 회귀 목표(최대 F1 0.68)보다 더 높은 F1 스코어(최대 0.81)를 달성하여 정상 및 이상 로그 패턴 간의 분리 능력이 뛰어나다는 것을 시사한다.
  • B-similar 변경 상황(소규모 변경)에서는 BERT가 높은 F1 스코어 0.75(분류)를 유지했지만, GPT-2는 0.43으로 급격히 하락하여 BERT의 안정성을 입증했다.
  • B-different 상황(대규모 의미 변화)에서는 BERT가 회귀 기반으로 F1 0.68, 분류 기반으로 F1 0.81을 기록했으며, GPT-2와 XL-Net를 크게 앞서는 성능을 보였다.
  • 모델 전이 전략은 소프트웨어 업데이트 후 오진을 효과적으로 줄였으며, BERT 기반 모델이 변경된 로그 분포 전반에서 가장 일관된 성능을 보였다.
  • 모델는 로그 메시지 변경에 대해 강력한 저항성을 보였으며, 모든 조건에서 F1 스코어가 0.6 이상 유지되어 실제 운영 환경에서의 이식 가능성과 강건성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.