Skip to main content
QUICK REVIEW

[논문 리뷰] LILAC: Log Parsing using LLMs with Adaptive Parsing Cache

Zhihan Jiang, Jinyang Liu|arXiv (Cornell University)|2023. 10. 03.
Natural Language Processing Techniques인용 수 6
한 줄 요약

LILAC는 고정된 파싱 캐시를 활용해 고정밀도 및 고효율적인 로그 파싱을 달성하는 새로운 로그 파싱 프레임워크이다. 고품질의 컨텍스트 내 학습 예시를 위한 계층적 후보 샘플링을 사용하고, 파싱 템플릿을 동적으로 캐시/새로 고치는 방식으로, 최신 기술 대비 F1 점수를 69.5% 향상시키며 LLM 쿼리 수를 수개의 주기수만큼 감소시킨다.

ABSTRACT

Log parsing transforms log messages into structured formats, serving as the prerequisite step for various log analysis tasks. Although a variety of log parsing approaches have been proposed, their performance on complicated log data remains compromised due to the use of human-crafted rules or learning-based models with limited training data. The recent emergence of powerful large language models (LLMs) demonstrates their vast pre-trained knowledge related to code and logging, making it promising to apply LLMs for log parsing. However, their lack of specialized log parsing capabilities currently hinders their accuracy in parsing. Moreover, the inherent inconsistent answers, as well as the substantial overhead, prevent the practical adoption of LLM-based log parsing. To address these challenges, we propose LILAC, the first practical log parsing framework using LLMs with adaptive parsing cache. To facilitate accurate and robust log parsing, LILAC leverages the in-context learning (ICL) capability of the LLM by performing a hierarchical candidate sampling algorithm and selecting high-quality demonstrations. Furthermore, LILAC incorporates a novel component, an adaptive parsing cache, to store and refine the templates generated by the LLM. It helps mitigate LLM's inefficiency issue by enabling rapid retrieval of previously processed log templates. In this process, LILAC adaptively updates the templates within the parsing cache to ensure the consistency of parsed results. The extensive evaluation on public large-scale datasets shows that LILAC outperforms state-of-the-art methods by 69.5% in terms of the average F1 score of template accuracy. In addition, LILAC reduces the query times to LLMs by several orders of magnitude, achieving a comparable efficiency to the fastest baseline.

연구 동기 및 목표

  • 실세계 시스템에서 LLM 기반 로그 파싱의 낮은 정확도와 높은 추론 비용 문제를 해결하기 위해.
  • 대규모이고 복잡한 로그 데이터를 파싱할 때 LLM의 일관성 부족과 비효율성을 극복하기 위해.
  • 광범위한 레이블링 데이터에 의존하는 것을 줄이고, 최소한의 인간 레이블링 예시를 통해 효과적인 컨텍스트 내 학습을 가능하게 하기 위해.
  • 새로운 적응형 파싱 캐시 메커니즘을 통해 파싱의 강건성과 효율성을 향상시키기 위해.
  • 실제 로그 분석 파이프라인에 LLM을 실용적으로 구현하기 위해.

제안 방법

  • 계층적 후보 샘플링 알고리즘을 통해 고품질의 로그 메시지 예시를 선택하여 컨텍스트 내 학습(ICL)을 활용한다.
  • 이전에 생성된 로그 템플릿을 저장하고 검색하기 위해 적응형 파싱 캐시를 사용한다. 이로써 중복된 LLM 쿼리를 줄인다.
  • 새로운 로그 메시지를 기존 템플릿과 의미적 유사도를 기반으로 정렬함으로써 일관성을 확보하는 캐시 매칭 메커니즘을 도입한다.
  • 적응형 템플릿 업데이트를 적용하여 캐시된 템플릿을 시간이 지남에 따라 정교화하고 발전시켜 장기적인 파싱 일관성을 향상시킨다.
  • 레이블링된 로그 메시지의 작고 효율적인 세트(예: 32개)를 사용해 ICL 프로세스를 부트스트랩함으로써 레이블링 오버헤드를 최소화한다.
  • LLM 추론과 캐시 기반 검색을 조합하여 정확도와 효율성의 균형을 이루며, 기준 수준에 가까운 속도를 달성한다.

실험 결과

연구 질문

  • RQ1광범위한 미세조정이나 대규모 레이블링 데이터 없이 LLM을 효과적이고 효율적으로 로그 파싱에 활용할 수 있는가?
  • RQ2반복적인 추론 중 LLM의 본질적인 일관성 부족 문제는 어떻게 완화할 수 있는가?
  • RQ3적응형 캐싱 메커니즘이 높은 파싱 정확도를 유지하면서 LLM 쿼리 수를 얼마나 줄일 수 있는가?
  • RQ4최소한의 레이블 예시로도 컨텍스트 내 학습을 통해 고성능 로그 파싱이 가능할 수 있는가?
  • RQ5실세계 데이터셋에서 최신 기술 대비 제안된 프레임워크의 정확도와 효율성 측면에서의 성능 비교는 어떠한가?

주요 결과

  • LILAC는 공개된 대규모 데이터셋에서 최신 기술 대비 평균 F1 점수를 69.5% 향상시켰다.
  • 프레임워크는 LLM 쿼리 수를 수개의 주기수만큼 감소시켜, 가장 빠른 비-LLM 기반 베이스라인 수준의 효율성에 가까워졌다.
  • 단지 32개의 레이블된 로그 메시지만으로도 LILAC는 뚜렷이 향상된 파싱 정확도를 달성하여, ICL 및 캐싱 전략의 효과성을 입증했다.
  • 적응형 파싱 캐시는 반복 쿼리 간 일관된 템플릿 생성을 보장하여, LLM 기반 파싱의 핵심 제약 사항을 해결했다.
  • 캐시 기능이 없고 높은 쿼리 오버헤드를 겪는 기존의 LLM 기반 방법들인 LogDiv 및 LLM-Parsing보다 LILAC가 뛰어난 성능을 보였다.
  • 복잡한 실세계 로그 데이터셋에서도 LILAC는 높은 정확도를 유지하며 강건성과 확장성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.