Skip to main content
QUICK REVIEW

[논문 리뷰] Self-Supervised Log Parsing

Sasho Nedelkoski, Jasmin Bogatinovski|arXiv (Cornell University)|2020. 03. 17.
Software System Performance and Reliability참고 문헌 20인용 수 4
한 줄 요약

이 논문은 트랜스포머 기반 아키텍처를 사용하여 로그 파싱을 마스크된 언어 모델링(Masked Language Modeling, MLM)으로 공식화하는 NuLog을 제안한다. 마스크된 토큰을 예측함으로써 NuLog은 구조화된 로그 템플릿과 조밀한 벡터 임베딩을 동시에 추출하며, 10개의 실세계 데이터셋에서 12개의 기존 방법보다 뛰어난 성능을 보이며 평균 99%의 파싱 정확도를 달성하고, 이상 탐지 작업에 대해 F1 스코어 최대 0.999를 기록한다.

ABSTRACT

Logs are extensively used during the development and maintenance of software systems. They collect runtime events and allow tracking of code execution, which enables a variety of critical tasks such as troubleshooting and fault detection. However, large-scale software systems generate massive volumes of semi-structured log records, posing a major challenge for automated analysis. Parsing semi-structured records with free-form text log messages into structured templates is the first and crucial step that enables further analysis. Existing approaches rely on log-specific heuristics or manual rule extraction. These are often specialized in parsing certain log types, and thus, limit performance scores and generalization. We propose a novel parsing technique called NuLog that utilizes a self-supervised learning model and formulates the parsing task as masked language modeling (MLM). In the process of parsing, the model extracts summarizations from the logs in the form of a vector embedding. This allows the coupling of the MLM as pre-training with a downstream anomaly detection task. We evaluate the parsing performance of NuLog on 10 real-world log datasets and compare the results with 12 parsing techniques. The results show that NuLog outperforms existing methods in parsing accuracy with an average of 99% and achieves the lowest edit distance to the ground truth templates. Additionally, two case studies are conducted to demonstrate the ability of the approach for log-based anomaly detection in both supervised and unsupervised scenario. The results show that NuLog can be successfully used to support troubleshooting tasks. The implementation is available at https://github.com/nulog/nulog.

연구 동기 및 목표

  • 기존의 수동 히ュ리스틱이나 도메인 특화 규칙에 의존하는 로그 파싱 방법의 한계를 해결하기 위해.
  • 다양한 IT 시스템에 일반화 가능하고 인간 간섭 최소화가 가능한 로그 파싱 기법을 개발하기 위해.
  • 학습된 로그 표현을 이상 탐지와 같은 후속 작업에 활용할 수 있도록 하기 위해.
  • 로그 파싱에서 자기지도 학습의 효과성과 이상 탐지 작업으로의 전이 가능성 평가하기 위해.

제안 방법

  • 트랜스포머 기반 모델을 사용하여 로그 파싱을 마스크된 언어 모델링(MLM) 작업으로 공식화한다.
  • 로그 메시지의 맥락을 나타내는 조밀한 벡터 표현을 [CLS] 토큰의 임베딩을 활용하여 생성한다.
  • 마스크된 토큰을 예측함으로써 상수적인 로그 템플릿 부분(정확한 예측)과 변동성이 있는 매개변수 부분(부정확한 예측)을 구분한다.
  • 후속 이상 탐지 작업을 위한 사전 지식으로 사전 훈련된 MLM 표현을 활용한다.
  • 최종 소프트맥스 레이어를 이元 분류 헤드로 교체하여 지도 학습 기반 이상 탐지 작업을 위한 미세조정을 수행한다.
  • 낮은 신뢰도를 가진 마스크된 토큰 예측 비율이 높은 로그 메시지를 이상으로 간주하여 비지도 이상 탐지 적용한다.

실험 결과

연구 질문

  • RQ1자기지도 학습 기반 마스크된 언어 모델링이 최소한의 인간 간섭으로 반구조화된 로그 메시지를 구조화된 템플릿으로 효과적으로 파싱할 수 있는가?
  • RQ2다양한 실세계 데이터셋에서 NuLog의 파싱 성능은 기존의 로그 파싱 기법들과 비교해 어떻게 되는가?
  • RQ3자기지도 파싱 단계에서 학습된 로그 임베딩 표현은 후속 이상 탐지 작업으로 효과적으로 전이될 수 있는가?
  • RQ4NuLog의 지도 및 비지도 이상 탐지 시나리오에서의 성능은 어떠한가?

주요 결과

  • NuLog은 10개의 실세계 로그 데이터셋에서 평균 99%의 파싱 정확도를 달성하며, 12개의 기존 로그 파싱 방법보다 뛰어난 성능을 보였다.
  • NuLog은 참값 템플릿과의 에디트 거리가 가장 낮아, 파싱 시 높은 구조적 일치도를 나타냈다.
  • BGL 데이터셋에서 비지도 이상 탐지 시 NuLog은 F1 스코어 0.999, 정밀도 1.000, 재현도 0.999를 기록했다.
  • 지도 학습 기반 이상 탐지에서는 단 두 에포크의 미세조정만으로도 F1 스코어 0.999를 달성하여 학습된 표현의 강력한 전이 가능성과 효율성을 입증했다.
  • 클라우드 인프라, 모바일 OS, 애플리케이션 로그 등 다양한 시스템에서 우수한 일반화 성능를 보였으며, 도메인 특화 적응이 최소한이었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.