[논문 리뷰] Prompting for Automatic Log Template Extraction
이 논문은 대규모 언어 모델(Large Language Models, LLMs)을 사용하여 문맥 내 학습을 활용하고 다양한 대표성 있는 로그 예시에 대한 프롬프트를 제공함으로써, 모델 미세조정 없이도 로그 템플릿을 추출하는 테이닝 프리(log parsing) 프레임워크인 LogDiv를 제안한다. 모델 미세조정 없이도 16개의 공개 데이터셋에서 97.7%의 파싱 정확도, 88.1%의 정밀도 템플릿 정확도, 90.8%의 재현율 템플릿 정확도를 기록하며 최신 기술 수준(SOTA) 성능을 달성한다.
Log parsing, which involves log template extraction from semi-structured logs to produce structured logs, is the first and the most critical step in automated log analysis. However, current log parsers suffer from limited effectiveness for two reasons. First, traditional data-driven log parsers solely rely on heuristics or handcrafted features designed by domain experts, which may not consistently perform well on logs from diverse systems. Second, existing supervised log parsers require model tuning, which is often limited to fixed training samples and causes sub-optimal performance across the entire log source. To address this limitation, we propose DivLog, an effective log parsing framework based on the in-context learning (ICL) ability of large language models (LLMs). Specifically, before log parsing, DivLog samples a small amount of offline logs as candidates by maximizing their diversity. Then, during log parsing, DivLog selects five appropriate labeled candidates as examples for each target log and constructs them into a prompt. By mining the semantics of examples in the prompt, DivLog generates a target log template in a training-free manner. In addition, we design a straightforward yet effective prompt format to extract the output and enhance the quality of the generated log templates. We conducted experiments on 16 widely-used public datasets. The results show that DivLog achieves (1) 98.1% Parsing Accuracy, (2) 92.1% Precision Template Accuracy, and (3) 92.9% Recall Template Accuracy on average, exhibiting state-of-the-art performance.
연구 동기 및 목표
- 히우리틱 규칙이나 도메인 전용 특징에 의존하는 기존 로그 파서의 한계를 해결하기 위해.
- 제한된 훈련 데이터에서 모델 튜닝이 필요한 딥 러닝 기반 파서의 낮은 일반화 성능을 극복하기 위해.
- 모델 미세조정 없이도 LLM의 문맥 내 학습 능력을 활용하는 로그 파싱 프레임워크를 개발하기 위해.
- 다양한 로그 소스에서 템플릿 구조가 다양하고 분포가 균형 잡히지 않은 경우에도 강건성과 정확도를 향상시키기 위해.
- 출력 품질을 향상시키고 일관된 로그 템플릿 생성을 보장하기 위해 프롬프트 형식을 설계하기 위해.
제안 방법
- LogDiv는 로그 템플릿 생성을 위해 GPT-3를 백본 LLM으로 사용하여 문맥 내 학습을 수행한다.
- 다양한 로그 메시지를 선택하여 후보 프롬프트 예시 세트를 구성한다.
- 각 대상 로그 메시지에 대해 의미적 유사도 기반으로 후보 세트에서 상위 5개의 유사도가 높은 로그를 검색한다.
- 검색된 로그와 그에 해당하는 템플릿을 특수한 프롬프트 형식으로 정렬하여 LLM의 출력을 이끌어낸다.
- 이 프롬프트 형식은 LLM의 출력을 유효한 로그 템플릿 문법으로 제약하여 신뢰성과 품질을 향상시키기 위해 특별히 설계되었다.
- LogDiv는 모델 미세조정이나 재학습 없이도 LLM 추론을 통해 최종 로그 템플릿을 생성한다.
실험 결과
연구 질문
- RQ1LLM을 사용한 문맥 내 학습이 모델 미세조정이나 수작업 특징 없이 효과적으로 로그 템플릿을 추출할 수 있는가?
- RQ2템플릿 복잡도가 다양하고 분포가 균형 잡히지 않은 다양한 로그 소스에서 LogDiv의 성능은 어떠한가?
- RQ3철저히 설계된 프롬프트 형식이 LLM으로부터 품질과 일관성 있는 로그 템플릿 생성을 향상시킬 수 있는가?
- RQ4파싱 정확도와 강건성 측면에서 기존의 비지도 및 지도 학습 기반 로그 파서와 비교해 LogDiv는 어떤가?
- RQ5매우 다양한 로그 패턴과 저빈도 템플릿을 포함한 데이터셋 간에 LogDiv는 일반화 성능을 보일 수 있는가?
주요 결과
- LogDiv는 16개의 공개 데이터셋에서 평균 97.7%의 파싱 정확도를 기록하여 기존 방법들을 능가한다.
- 정밀도 템플릿 정확도가 88.1%에 도달하여 이전 최신 기술 수준 방법보다 뚜렷이 높다.
- 재현율 템플릿 정확도는 90.8%에 이르며, 희귀하거나 복잡한 로그 템플릿의 강력한 커버리지가 가능함을 시사한다.
- LogDiv는 최고의 베이스라인 대비 파싱 정확도 3.86%p, 정밀도 템플릿 정확도 20.4%p, 재현율 템플릿 정확도 16.7%p 향상된 성능을 기록한다.
- Mac 및 Proxifier와 같이 템플릿 다양성이 높고 로그 빈도가 균형 잡히지 않은 데이터셋에서도 강건한 성능을 보여준다.
- 제거 실험 결과에 따르면, 프롬프트 설계와 예시 선택의 다양성 인식 기반 전략이 높은 성능을 내기 위해 필수적임을 확인했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.