Skip to main content
QUICK REVIEW

[논문 리뷰] A Large-Scale Evaluation for Log Parsing Techniques: How Far Are We?

Zhihan Jiang, Jinyang Liu|arXiv (Cornell University)|2023. 08. 21.
Natural Language Processing Techniques인용 수 4
한 줄 요약

이 논문은 14개의 정제된 로그 컬렉션(평균 360만 라인)으로 구성된 대규모 실세계 기반 데이터셋인 Loghub-2.0를 소개하고, 15종의 최첨단 로그 파서에 대한 철저한 평가를 수행한다. 클래스 불균형 문제를 해결하기 위해 새로운 템플릿 수준의 평가 지표를 제안하며, 특히 희귀 로그 템플릿과 파라미터가 많은 로그 템플릿에 대해 기존 파서들이 겪는 심각한 성능 격차를 드러내어 실세계 적용을 위한 설계 개선의 필요성을 강조한다.

ABSTRACT

Log data have facilitated various tasks of software development and maintenance, such as testing, debugging and diagnosing. Due to the unstructured nature of logs, log parsing is typically required to transform log messages into structured data for automated log analysis. Given the abundance of log parsers that employ various techniques, evaluating these tools to comprehend their characteristics and performance becomes imperative. Loghub serves as a commonly used dataset for benchmarking log parsers, but it suffers from limited scale and representativeness, posing significant challenges for studies to comprehensively evaluate existing log parsers or develop new methods. This limitation is particularly pronounced when assessing these log parsers for production use. To address these limitations, we provide a new collection of annotated log datasets, denoted Loghub-2.0, which can better reflect the characteristics of log data in real-world software systems. Loghub-2.0 comprises 14 datasets with an average of 3.6 million log lines in each dataset. Based on Loghub-2.0, we conduct a thorough re-evaluation of 15 state-of-the-art log parsers in a more rigorous and practical setting. Particularly, we introduce a new evaluation metric to mitigate the sensitivity of existing metrics to imbalanced data distributions. We are also the first to investigate the granular performance of log parsers on logs that represent rare system events, offering in-depth details for software diagnosis. Accurately parsing such logs is essential, yet it remains a challenge. We believe this work could shed light on the evaluation and design of log parsers in practical settings, thereby facilitating their deployment in production systems.

연구 동기 및 목표

  • Loghub-2k와 같은 기존 로그 파싱 기준점이 실세계 로그 분포의 대표성 부족과 규모 작음 등의 한계를 보이는 데 대비하여 이를 해결하고자 한다.
  • 실세계 시스템 로그 데이터의 규모와 다양성을 더 잘 반영하는 대규모 실용적 데이터셋(Loghub-2.0)을 개발하고자 한다.
  • 클래스 불균형에 민감하지 않은 새로운 평가 프로토콜을 제안하며, 이는 템플릿 수준의 F1 스코어를 통해 데이터 불균형 문제를 완화한다.
  • 희귀 로그 템플릿과 파라미터가 많은 로그 템플릿에서 최첨단 로그 파서의 성능을 종합적으로 평가하여, 시스템 진단에 핵심적인 역할을 하는 희귀 및 복잡한 로그 패턴에 대한 이해를 심화하고자 한다.
  • 현재 로그 파서의 주요 단점, 특히 효율성과 복잡한 로그 패턴 처리 능력 측면에서의 결함을 규명하여 향후 연구 방향을 안내하고자 한다.

제안 방법

  • 14개의 실세계 시스템에서 로그 템플릿과 파라미터를 정제하는 데 있어 높은 정확성과 일관성을 확보하기 위해 다섯 명의 경험이 풍부한 연구자가 참여한 엄격한 정제 프레임워크를 설계하였다.
  • 총 5,000만 건 이상의 로그 라인을 포함하는 14개의 로그 컬렉션을 포함하는 새로운 벤치마크 데이터셋인 Loghub-2.0를 구축하였다. 각 데이터셋은 실세계 시스템의 특성을 반영하고 있다.
  • 클래스 불균형으로 인한 편향을 줄이고 희귀 템플릿에서의 파서 성능 평가를 더 정확하게 하기 위해, 템플릿 수준의 F1 스코어를 제안하였다.
  • 전반적인 정확도, 희귀 템플릿에서의 성능, 파라미터가 많은 템플릿에서의 성능, 효율성 등 여러 차원에서 파서를 평가하는 통합 벤치마크 프로토콜을 구현하였다.
  • 모든 도구에서 일관된 구현과 하이퍼파라미터 튜닝을 수행하며, Loghub-2.0 기반으로 15종의 최첨단 로그 파서에 대한 대규모 재평가를 수행하였다.
  • 빈도 발생 수와 파라미터 수 등 다양한 로그 특성에 따라 파서의 동작을 분석하여 숨겨진 성능 문제를 규명하였다.

실험 결과

연구 질문

  • RQ1기존 로그 파서는 Loghub-2k에서 보고된 결과와는 달리, 대규모 실세계 로그 데이터에서 어떻게 성능을 발휘하는가?
  • RQ2현행 로그 파서는 시스템 진단에 핵심적인 역할을 하는 희귀 로그 템플릿과 파라미터가 많은 로그 패턴에서 어느 정도 어려움을 겪는가?
  • RQ3제안된 템플릿 수준의 F1 지표는 로그 파싱 평가에서 불균형한 데이터 분포로 인한 편향을 얼마나 효과적으로 줄이는가?
  • RQ4현재 로그 파서의 주요 성능 저하 요인은 무엇인가? 특히 대규모 프로덕션 환경에서의 효율성과 엣지 케이스에서의 정확도 측면에서 말이다.
  • RQ5향후 로그 파싱 기법은 어떻게 개선되어야 하며, 실세계 시스템에서 희귀하고 복잡한 로그 패턴을 더 잘 처리할 수 있는가?

주요 결과

  • Drain, Logram, LogPPT와 같은 최첨단 도구를 포함한 기존 로그 파서는 Loghub-2k에서 뛰어난 성능을 보였지만, 희귀 로그 템플릿, 특히 오류 또는 치명적인 중요도를 가진 템플릿에서는 성능이 크게 떨어지는 것으로 나타났다.
  • 파라미터가 10개 이상인 템플릿에 대해서는 일부 파서가 F1 스코어 50% 미만을 기록하여, 복잡한 로그 구조를 처리하는 데 있어 심각한 격차가 있음을 시사한다.
  • 제안된 템플릿 수준의 F1 지표는 클래스 불균형에 의한 민감도를 효과적으로 감소시키며, 전통적인 메시지 수준 지표가 가리던 성능 격차를 드러낸다.
  • 많은 파서가 실세계의 효율성 기준을 충족하지 못하며, 특히 고속도의 로그 스트림을 처리할 경우 허용 가능한 임계값을 초과하는 처리 시간을 보였다.
  • 의미 기반 파서는 파라미터와 템플릿을 더 잘 구분할 수 있는 능력을 보였지만, 전역적 맥락의 부족으로 인해 그룹화 능력이 떨어져, 통계적 정보와 의미 정보를 통합할 필요성이 있음을 시사한다.
  • 본 연구는 현재 로그 파서가 희귀하고 복잡한 시스템 이벤트를 진단하는 데 최적화되어 있지 않음을 규명하였으며, 특히 프로덕션 배포를 위한 파서 설계 철학의 전환을 요구한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.