Skip to main content
QUICK REVIEW

[논문 리뷰] The Art and Practice of Data Science Pipelines: A Comprehensive Study of Data Science Pipelines In Theory, In-The-Small, and In-The-Large

Sumon Biswas, Mohammad Wardat|arXiv (Cornell University)|2021. 12. 02.
Data Quality and Management인용 수 9
한 줄 요약

이 논문은 이론적 프레임워크, 소규모 구현(in-the-small), 대규모 생산 시스템(in-the-large)의 세 가지 맥락에서 데이터 과학 파이프라인에 대한 종합적인 연구를 제시한다. 71개의 이론적 제안, 105개의 캐글 파이프라인, 21개의 깃허브 프로젝트를 분석한 결과, 소규모 작업에서 데이터 저장 및 배포와 같은 핵심 단계가 부재된 상당한 구조적 차이를 확인하였으며, 각 맥락에 맞는 독립적이고 맥락 인식형 표현 방식을 제안함으로써 실무 및 연구 분야에서 데이터 과학 파이프라인의 설계와 이해를 발전시켰다.

ABSTRACT

Increasingly larger number of software systems today are including data science components for descriptive, predictive, and prescriptive analytics. The collection of data science stages from acquisition, to cleaning/curation, to modeling, and so on are referred to as data science pipelines. To facilitate research and practice on data science pipelines, it is essential to understand their nature. What are the typical stages of a data science pipeline? How are they connected? Do the pipelines differ in the theoretical representations and that in the practice? Today we do not fully understand these architectural characteristics of data science pipelines. In this work, we present a three-pronged comprehensive study to answer this for the state-of-the-art, data science in-the-small, and data science in-the-large. Our study analyzes three datasets: a collection of 71 proposals for data science pipelines and related concepts in theory, a collection of over 105 implementations of curated data science pipelines from Kaggle competitions to understand data science in-the-small, and a collection of 21 mature data science projects from GitHub to understand data science in-the-large. Our study has led to three representations of data science pipelines that capture the essence of our subjects in theory, in-the-small, and in-the-large.

연구 동기 및 목표

  • 이론적 프레임워크, 소규모 구현, 대규모 생산 시스템에서의 데이터 과학 파이프라인 아키텍처 특성 이해.
  • 이론적 파이프라인 모델과 실제 데이터 과학 워크플로우에서의 구현 간 격차 규명.
  • 개발 규모(소규모 대비 대규모)에 따라 파이프라인 단계, 조직 방식, 특성의 변화 탐구.
  • 연구 및 산업 분야에서 더 나은 설계와 구현을 뒷받침하는 실용적이고 맥락 인식형 데이터 과학 파이프라인 표현 제공.
  • 이론적 데이터 과학 라이프사이클 모델과 소프트웨어 공학 실무에서의 실제 활용 간 격차 해소.

제안 방법

  • 학술 문헌에서 제시한 71개의 이론적 데이터 과학 파이프라인 제안을 체계적으로 분석하여 공통 단계와 패턴을 추출하고 분류.
  • 캐글 경진대회에서 105개의 데이터 과학 파이프라인을 수집하고 분석하여 소규모 구현(단일 데이터 과학자 워크플로우 중심)을 연구.
  • 깃허브에서 21개의 성숙한 팀 기반 데이터 과학 프로젝트를 수집하고 분석하여 대규모 생산 시스템을 연구.
  • 비교적 다중 맥락적 접근을 통해 세 맥락에서 반복되는 단계, 조직 구조, 특징 패턴을 규명.
  • 실증적 발견 기반으로 이론, 소규모, 대규모를 반영한 세 가지 독립적 맥락 특화 파이프라인 표현 방식 개발.
  • 파이프라인 단계(예: 데이터 확보, 모델링, 평가 등)를 맵핑하기 위한 체계적 코딩 체계 적용으로, 맥락 간 비교 가능화.

실험 결과

연구 질문

  • RQ1이론적 프레임워크에서 데이터 과학 파이프라인의 核심 단계는 무엇이며, 실제 구현과 비교해 볼 때 어떻게 다를까?
  • RQ2소규모(in-the-small, 캐글 기반)와 대규모(in-the-large, 깃허브 기반) 맥락에서 데이터 과학 파이프라인의 조직 구조는 어떻게 다를까?
  • RQ3이론적 모델에 비해 소규모 데이터 과학 워크플로우에서 빠지거나 부족하게 표현되는 파이프라인 단계는 무엇일까?
  • RQ4생산 수준의 시스템과 학술적 또는 경쟁 기반 설정 간에 데이터 과학 파이프라인의 주요 패턴과 특성은 어떻게 다를까?
  • RQ5이론적, 소규모, 대규모 데이터 과학 파이프라인에서 데이터 준비, 특징 공학, 배포의 역할은 어떻게 다를까?

주요 결과

  • 소규모 파이프라인에는 11개 이론적 단계 중 6개(예: 데이터 확보, 전처리, 모델링, 평가, 배포, 모니터링)만 존재했으며, 특히 데이터 저장 및 모니터링 단계가 빈곤하게 나타남.
  • 소규모 파이프라인은 데이터 탐색과 반복적 프로토타이핑에 중점을 두고 선형적 구조를 띠었으며, 대규모 시스템에서 관찰되는 모듈화 및 확장성 있는 조직 방식이 부재함.
  • 대규모 프로젝트에서는 더 복잡하고 비선형적인 파이프라인 구조를 보였으며, 명시적 분리, 버전 관리, 모니터링 단계가 포함되어 있어 생산 수준의 소프트웨어 공학 관행 반영.
  • 이론적 프레임워크는 자주 데이터 저장 및 모델 모니터링 단계를 포함하지만, 캐글 기반 구현에서는 이들이 빈번히 생략되어 있어 이론과 실천 간 격차 존재.
  • 이론적으로 모델링 및 평가 단계에 대한 공감대가 있으나, 이들의 구현 빈도와 형태는 맥락에 따라 상당히 다름. 특히 소규모 파이프라인은 단계를 통합하거나 생략하는 경향이 있음.
  • 이 연구는 MLOps 관행(예: CI/CD, 로깅, 모델 버전 관리)이 대규모 프로젝트에서는 체계적으로 존재하지만, 소규모에서는 대부분 생략되어 있어 데이터 과학 엔지니어링의 성숙도 격차를 드러냄.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.