Skip to main content
QUICK REVIEW

[논문 리뷰] Navigating the Data Lake with Datamaran: Automatically Extracting Structure from Log Datasets

Yihan Gao, Silu Huang|arXiv (Cornell University)|2017. 08. 29.
Web Data Mining and Analysis참고 문헌 27인용 수 4
한 줄 요약

Datamaran은 기존의 레코드 구조에 대한 사전 지식 없이도 반구조화된 로그 데이터셋에서 필드 및 레코드 경계를 식별함으로써 자동으로 구조화된 관계형 데이터를 추출하는 비지도 학습 도구이다. 다중 라인 레코드와 노이즈가 있는 포맷을 다룰 수 있도록 템플릿 생성, 통합 점수 평가, 반복적 정밀 조정을 조합함으로써 GitHub 로그 데이터셋에서 95.5%의 추출 정확도를 달성하였으며, 이는 이전 비지도 방법 대비 66% 높은 성능이다.

ABSTRACT

Organizations routinely accumulate semi-structured log datasets generated as the output of code; these datasets remain unused and uninterpreted, and occupy wasted space - this phenomenon has been colloquially referred to as "data lake" problem. One approach to leverage these semi-structured datasets is to convert them into a structured relational format, following which they can be analyzed in conjunction with other datasets. We present Datamaran, an tool that extracts structure from semi-structured log datasets with no human supervision. Datamaran automatically identifies field and record endpoints, separates the structured parts from the unstructured noise or formatting, and can tease apart multiple structures from within a dataset, in order to efficiently extract structured relational datasets from semi-structured log datasets, at scale with high accuracy. Compared to other unsupervised log dataset extraction tools developed in prior work, Datamaran does not require the record boundaries to be known beforehand, making it much more applicable to the noisy log files that are ubiquitous in data lakes. Datamaran can successfully extract structured information from all datasets used in prior work, and can achieve 95% extraction accuracy on automatically collected log datasets from GitHub - a substantial 66% increase of accuracy compared to unsupervised schemes from prior work. Our user study further demonstrates that the extraction results of Datamaran are closer to the desired structure than competing algorithms.

연구 동기 및 목표

  • 방대한 반구조화된 로그 데이터셋이 레코드의 구조가 없어 활용되지 못하는 '데이터 레이크' 문제를 해결하기 위해.
  • 기존의 비지도 로그 추출 도구들이 레코드 경계를 사전에 알고 있어야 하거나 단일 라인 레코드를 전제로 하여 제한되는 문제를 극복하기 위해.
  • 원시 로그 파일을 구조화된 관계형 형식으로 전환하는 완전 자동화, 확장성 있고 정확한 변환을 가능하게 하기 위해.
  • 하나의 데이터셋 내에서 다중 라인 레코드, 노이즈가 있는 포맷, 이질적인 구조를 처리할 수 있는 견고한 솔루션을 제공하기 위해.
  • 정량적 벤치마크와 사용자 연구를 통해 기존 도구들인 RecordBreaker 및 이전 비지도 래퍼 대비 뛰어난 성능과 사용성 확보하기 위해.

제안 방법

  • 사람의 판단과 일치하는 규칙성 점수 함수를 사용하여 구조 추출을 최적화 문제로 수식화하기 위해.
  • 로그 라인 전반에 걸쳐 최소 커버리지 기준을 충족하는 반복 패턴을 식별하여 후보 구조 템플릿을 생성하기 위해.
  • 가장 일관되고 타당한 템플릿을 순위 매기고 걸러내기 위해 통합 점수 함수를 사용한 정제 단계 적용하기 위해.
  • 남은 템플릿의 반복적 평가 및 정밀 조정을 통해 구조적 정확도와 일관성을 향상시키기 위해.
  • 외부 청크 분할 또는 태깅에 의존하지 않고 라인 수준의 분석을 통해 필드 및 레코드 경계를 탐지하기 위해.
  • 하나의 데이터셋 내에서 다중 구조 탐지 기능을 지원하여 동일한 로그 파일에서 여러 개의 서로 다른 레코드 유형을 추출할 수 있도록 하기 위해.

실험 결과

연구 질문

  • RQ1기존의 레코드 경계 지식 없이도 비지도 시스템이 반구조화된 로그 파일에서 구조화된 관계형 데이터를 자동으로 추출할 수 있는가?
  • RQ2복잡하고 다중 라인, 노이즈가 있는 형식을 가진 실제 로그 데이터셋에서 Datamaran은 기존 비지도 도구들에 비해 얼마나 효과적으로 구조를 추출하는가?
  • RQ3사용자 연구를 통해 검증된 결과로 볼 때, Datamaran의 출력 결과는 인간이 기대하는 데이터 구조와 얼마나 일치하는가?
  • RQ4기업용 데이터 레이크에서 발견되는 다양한 로그 형식과 파rameter 변화에 대해 Datamaran은 얼마나 견고한가?
  • RQ5Datamaran은 하나의 로그 파일 내에서 서로 다른 여러 개의 데이터 구조를 탐지하고 추출할 수 있는가? 이는 더 포괄적인 데이터 탐색을 가능하게 하는가?

주요 결과

  • Datamaran은 대규모 GitHub 로그 데이터셋 컬렉션에서 95.5%의 추출 정확도를 달성하였으며, 이는 이전 비지도 방법 대비 66% 향상된 성능이다.
  • 이전 연구에서 사용된 모든 대표적 데이터셋에서 성공적으로 구조를 추출하여 광범위한 적용 가능성을 입증하였다.
  • 사용자 연구에서 6명의 참가자 전원이 Datamaran의 출력 결과를 RecordBreaker 및 원본 로그 파일보다 선호하였으며, 인간의 기대와의 높은 일치성을 보였다.
  • 동일한 GitHub 데이터셋 컬렉션에서 RecordBreaker는 오직 29.2%의 추출 정확도를 기록하여 Datamaran에 비해 떨어졌다.
  • 시스템은 파rameter 선택에 대해 뛰어난 내성적 안정성을 유지하며 다양한 로그 형식과 노이즈 수준에서도 높은 성능을 유지를 하였다.
  • Datamaran은 이전 도구들이 갖추지 못한 기능인 하나의 로그 파일 내에서 서로 다른 여러 개의 데이터 구조를 탐지하고 추출할 수 있다는 점에서 유일한 특징을 지녔다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.