Skip to main content
QUICK REVIEW

[논문 리뷰] Data Engineering for Data Analytics: A Classification of the Issues, and Case Studies

Alfredo Nazábal, Christopher K. I. Williams|arXiv (Cornell University)|2020. 04. 27.
Big Data and Business Intelligence인용 수 9
한 줄 요약

이 논문은 데이터 분석 분야의 데이터 엔지니어링 과제를 체계적으로 분류하여 세 가지 고수준 범주로 나누며, 데이터 정리, 데이터 품질, 특징 공학을 포함한다. 공개된 데이터셋과 정제 파이프라인을 활용한 네 가지 실제 사례 연구를 제시하며, 실용적인 워킹플로우를 보여주고 수작업 준비 작업을 줄이기 위한 자동화 도구의 필요성을 주장한다. 이는 향후 데이터 엔지니어링 자동화 분야의 연구 기반을 마련한다.

ABSTRACT

Consider the situation where a data analyst wishes to carry out an analysis on a given dataset. It is widely recognized that most of the analyst's time will be taken up with \\emph{data engineering} tasks such as acquiring, understanding, cleaning and preparing the data. In this paper we provide a description and classification of such tasks into high-levels groups, namely data organization, data quality and feature engineering. We also make available four datasets and example analyses that exhibit a wide variety of these problems, to help encourage the development of tools and techniques to help reduce this burden and push forward research towards the automation or semi-automation of the data engineering process.

연구 동기 및 목표

  • 데이터 엔지니어링 자동화 연구를 저해하는 표준화되지 않은 공개 가능한 더러운 데이터셋과 문서화된 정제 과정의 부족을 해결하기 위해.
  • 분석 작업 중 데이터 과학자들이 겪는 일반적인 데이터 워글링 문제를 식별하고 체계적으로 분류하기 위해.
  • 자동화된 데이터 준비 도구 개발을 위한 벤치마크가 될 수 있도록, 상세한 정제 워킹플로우를 포함한 실질적인 사례 연구를 제공하기 위해.
  • 데이터 엔지니어링의 자주 간과되는 노동 집약적인 성격을 부각시키며, 이는 데이터 과학자의 시간의 최대 80%를 차지할 수 있음을 강조하기 위해.
  • 데이터 과학 커뮤니티가 원시 데이터와 정제 스크립트를 공유하여 재현 가능성과 도구 개발을 촉진하도록 장려하기 위해.

제안 방법

  • 데이터 엔지니어링 문제를 세 단계로 분류하는 것을 제안함: 데이터 정리(데이터 파싱, 데이터 딕셔너리, 데이터 통합, 데이터 변환), 데이터 품질(표준화, 누락 데이터, 이질성, 비정상성), 특징 공학.
  • 다양한 분야(식물 특성, 가정용 전기 사용, 건강 기록, 대중 통신 설문)에서 온 네 가지 실제 데이터셋과 관련 분석 과제를 식별하고 문서화함.
  • 각 데이터셋에 대해 데이터 탐색, 스키마 식별, 정제 작업, 변환 단계를 포함한 전체 데이터 워글링 파이프라인을 상세히 기술함.
  • 작업 중심 접근법을 사용함: 각 데이터셋은 특정 머신러닝 모델의 입력으로 사용될 수 있도록 정제되며, 실제 분석 제약 조건을 반영함.
  • 모든 데이터셋에 걸쳐 체계적이고 단계적인 정제 과정을 적용함: 누락치 처리, 범주형 인코딩 표준화, 일관성 없는 스키마를 가진 다년간의 데이터 병합 등.
  • 모든 데이터셋과 정제 스크립트를 GitHub 리포지토리에 공개하여 재현 가능성과 도구 평가를 지원함.

실험 결과

연구 질문

  • RQ1실제 데이터셋을 분석하기 위해 준비할 때 데이터 과학자들이 자주 겪는 주요이고 반복적인 데이터 엔지니어링 과제는 무엇인가?
  • RQ2자동화 또는 반자동화 도구 개발을 지원하기 위해 데이터 엔지니어링 문제를 어떻게 체계적으로 분류할 수 있는가?
  • RQ3실제 분석 프로젝트에서의 실질적인 데이터 워글링 워킹플로우는 무엇이며, 이는 분야에 따라 어떻게 다를 수 있는가?
  • RQ4정제 과정이 문서화된 공개된 원시 데이터셋은 데이터 엔지니어링 및 자동화 분야의 연구를 얼마나 가속화할 수 있는가?
  • RQ5실제 데이터셋에서 하류 모델 성능에 가장 크게 영향을 주는 주요 데이터 품질 및 정리 문제는 무엇인가?

주요 결과

  • 데이터 통합, 누락치 처리, 스키마 표준화와 같은 데이터 엔지니어링 작업은 데이터 과학자의 시간의 최대 80%를 차지하며, 종종 최종 분석 결과에 기록되지 않는다.
  • 네 가지 사례 연구는 일관성 없는 스키마를 가진 연간 데이터의 통합이 주요 과제임을 입증하며, 수작업 기반의 컬럼 매칭, 이름 변경, 인코딩 표준화가 필요함을 보여줌.
  • 누락 데이터는 각 특성당 누락 비율이 1% 이하일 경우 인스턴스를 제거하는 방식으로 처리되었으며, 실용적일 수는 있지만 항상 최적의 접근 방식은 아님.
  • 다양한 데이터 품질 및 정리 문제에도 불구하고, 네 가지 데이터셋 모두 성공적으로 정제되었으며, 여러 분류기(Logistic Regression, Naive Bayes, SVM, Random Forest)에 사용되었으며, 2016년 테스트 세트에서 Random Forest가 F1 스코어 0.8686을 기록함.
  • 이 연구는 데이터 워글링이 매우 작업 의존적이며 보편적인 파이프라인이 없으며, 피드백 루프와 반복적 결정이 실제 워킹플로우에서 흔히 발생함을 드러냄.
  • 원시 데이터와 완전한 정제 스크립트의 가용성은 재현 가능성을 보장하며, 자동화된 데이터 엔지니어링 도구의 벤치마크 기초를 제공함.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.