[논문 리뷰] SemParser: A Semantic Parser for Log Analysis
SemParser는 로그 메시지에서 명시적이고 암묵적인 의미를 통합함으로써 문법 기반 로그 파서의 한계를 보완하는 새로운 의미 분석 파서이다. 이는 두 단계의 접근 방식—엔드 투 엔드 의미 정보 추출 및 맥락 지식을 통한 동시 파싱—을 사용하여 의미 정보 추출에서 평균 F1 스코어 0.985를 달성했으며, 이후 이상 탐지 및 장애 식별 모델의 성능을 각각 최대 11.7%와 8.65% 향상시켰다.
Logs, being run-time information automatically generated by software, record system events and activities with their timestamps. Before obtaining more insights into the run-time status of the software, a fundamental step of log analysis, called log parsing, is employed to extract structured templates and parameters from the semi-structured raw log messages. However, current log parsers are all syntax-based and regard each message as a character string, ignoring the semantic information included in parameters and templates. Thus, we propose the semantic-based parser SemParser to unlock the critical bottleneck of mining semantics from log messages. It contains two steps, an end-to-end semantic miner and a joint parser. Specifically, the first step aims to identify explicit semantics inside a single log, and the second step is responsible for jointly inferring implicit semantics and computing structural outputs based on the contextual knowledge base. To analyze the effectiveness of our semantic parser, we first demonstrate that it can derive rich semantics from log messages collected from six widely-applied systems with an average F1 score of 0.985. Then, we conduct two representative downstream tasks, showing that current downstream models improve their performance with appropriately extracted semantics by 1.2%-11.7% and 8.65% on two anomaly detection datasets and a failure identification dataset, respectively. We believe these findings provide insights into semantically understanding log messages for the log analysis community.
연구 동기 및 목표
- 파rameter와 템플릿에서 의미를 忽略하는 문법 기반 로그 파서의 한계를 해결하기 위해.
- 유의미한 토큰을 식별하고, 메시지 내 의미 관계를 추출하며, 메시지 간 관계를 유추하기 위해.
- 이상 탐지 및 장애 식별과 같은 이후 로그 분석 작업의 성능을 더 풍부한 의미 표현을 통해 향상시키기 위해.
- 이전 NER 기반 접근 방식의 폐쇄 세계 가정을 초월하는 확장성 있고 일반화 가능한 파서를 개발하기 위해.
- 의미 이해가 기존 로그 분석 모델의 성능을 크게 향상시킬 수 있음을 입증하기 위해.
제안 방법
- 두 단계 아키텍처: 첫 번째로, 엔드 투 엔드 의미 정보 추출기가 개별 로그 메시지 내에서 명시적 의미 역할을 식별한다.
- 두 번째로, 이전 로그에서 유도된 맥락 지식 기반 데이터베이스를 사용하여 은유적 의미를 추론하는 동시 파서가 작동한다.
- 도메인 특화 지식을 활용하여 파라미터 의미를 해결한다 (예: '949e1227'을 '셀 ID'로 매핑).
- 로그 간 맥락적 의존성을 통합하여 단일 메시지에 명시되지 않은 의미를 추론한다.
- 프레임워크는 엔드 투 엔드로 훈련되며 수작업 규칙이나 사전 정의된 엔터티 유형에 의존하지 않는다.
- 딥 러닝 모듈을 사용하여 로그 메시지를 인코딩하고 의미 레이블링 및 구조적 파싱을 동시에 최적화한다.
실험 결과
연구 질문
- RQ1의미 파서는 다양한 소프트웨어 시스템에서 개별 로그 메시지에서 명시적 의미를 효과적으로 추출할 수 있는가?
- RQ2이전 로그에서 유도된 맥락 지식이 로그 파라미터의 암묵적 의미 추론에 얼마나 기여하는가?
- RQ3의미 인식 파싱은 이상 탐지 및 장애 진단과 같은 이후 로그 분석 작업의 성능을 어떻게 향상시키는가?
- RQ4시스템 특화 규칙 설계 없이도 제안된 파서는 다양한 시스템 간에 일반화 가능한가?
- RQ5의미 파싱은 문법 기반 파서보다 의미 정확도와 이후 작업 효과성 측면에서 뛰어나다고 할 수 있는가?
주요 결과
- SemParser는 여섯 개의 널리 사용되는 소프트웨어 시스템에서 평균 F1 스코어 0.985를 기록하여 명시적 의미 식별의 높은 정확도를 입증했다.
- 이상 탐지에서 SemParser의 출력을 사용하는 모델은 문법 기반 파서 대비 1.2%에서 11.7%까지 성능 향상을 보였다.
- 장애 식별에서 SemParser가 추출한 의미 정보를 사용할 경우, 이후 모델의 성능이 8.65% 향상되었다.
- 동시 파싱 기법은 이전 로그의 맥락 지식을 활용하여 암묵적 의미—예: 파라미터 유형(예: 셀 ID)—을 성공적으로 유추했다.
- 수작업 규칙 생성이 필요 없고 빈도 기반 히우리스틱에 의존도를 줄임으로써, 이는 룰 기반 및 히우리스틱 기반 파서보다 우수한 성능을 보였다.
- 결과는 의미 이해가 이후 AI 기반 분석을 위한 로그 표현의 품질을 크게 향상시킨다는 것을 확인시켰다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.