Skip to main content
QUICK REVIEW

[논문 리뷰] Workload-Driven Vertical Partitioning for Effective Query Processing over Raw Data

Weijie Zhao, Yu Cheng|arXiv (Cornell University)|2015. 03. 31.
Advanced Database Systems and Queries참고 문헌 38인용 수 4
한 줄 요약

이 논문은 저장소 제약 조건 하에서 쿼리 처리 시간을 최소화하기 위해 원시 데이터의 수직 분할을 위한 워크로드 기반 이중 단계 휴리스틱을 제안한다. 부분적 로딩을 이진 수직 분할로 모델링하고 선형 혼합정수계획법(MIP)을 사용함으로써, 정확한 MIP 해법에 비해 훨씬 적은 시간에 거의 최적에 가까운 성능를 달성한다. 실세계의 CSV, FITS, JSON 워크로드를 대상으로 검증하였다.

ABSTRACT

Traditional databases are not equipped with the adequate functionality to handle the volume and variety of "Big Data". Strict schema definition and data loading are prerequisites even for the most primitive query session. Raw data processing has been proposed as a schema-on-demand alternative that provides instant access to the data. When loading is an option, it is driven exclusively by the current-running query, resulting in sub-optimal performance across a query workload. In this paper, we investigate the problem of workload-driven raw data processing with partial loading. We model loading as fully-replicated binary vertical partitioning. We provide a linear mixed integer programming optimization formulation that we prove to be NP-hard. We design a two-stage heuristic that comes within close range of the optimal solution in a fraction of the time. We extend the optimization formulation and the heuristic to pipelined raw data processing, scenario in which data access and extraction are executed concurrently. We provide three case-studies over real data formats that confirm the accuracy of the model when implemented in a state-of-the-art pipelined operator for raw data processing.

연구 동기 및 목표

  • 빅데이터 워크로드에서 불필요한 속성이 반복 저장되어 큰 비용이 발생하는 전통적인 스키마 기반 데이터 로딩의 비효율성을 해결하기 위해.
  • 원시 데이터의 부분적 로딩을 완전 복제를 수반하는 이진 수직 분할로 모델링하여, 어떤 속성을 로딩할지 최적화할 수 있도록 하기 위해.
  • 정확한 분할을 근사하는 데 있어 계산 시간을 크게 줄인 가용성 있는 이중 단계 휴리스틱을 설계하기 위해.
  • 데이터 접근과 추출이 동시에 일어나는 파이프라인 처리 환경에서 최적화 및 휴리스틱을 확장하기 위해.
  • 최신 파이프라인 연산자와 함께 실세계 데이터 포맷(CSV, FITS, JSON)을 대상으로 모델의 정확성과 휴리스틱의 성능을 검증하기 위해.

제안 방법

  • 부분적 로딩 문제를 선형 혼합정수계획법(MIP)으로 공식화하여, 이 문제가 NP-난해하고 근사가 불가능하다는 것을 증명한다.
  • 이중 단계 휴리스틱 설계: 첫 번째 단계에서는 가장 많은 쿼리를 충족시키는 속성을 선택하여 쿼리 커버리지를 최대화하고, 두 번째 단계에서는 사용 빈도에 따라 속성을 우선순위 정렬하여 분할을 정교화한다.
  • 데이터가 동시에 접근되고 추출되는 파이프라인 처리 환경를 고려해 MIP 공식화와 휴리스틱을 적응시킨다. 이로써 I/O 병목 현상을 줄일 수 있다.
  • 원시 데이터 처리를 위한 파이프라인 연산자로 구현하여, 동시에 데이터 접근과 속성 추출이 가능하도록 한다.
  • 실세계 워크로드(예: SDSS 카탈로그에서 100만 개의 쿼리)를 사용하여 정확도와 성능을 정점 실행 결과와 비교 평가한다.
  • 기존의 관계형 데이터베이스 관리 시스템(RDBMS) 기능인 BLOB 저장 및 동적 스키마 프omotion을 활용하면서도, 중복 데이터 복제를 최소화한다.

실험 결과

연구 질문

  • RQ1워크로드 기반 수직 분할이 저장소 예산 제약 조건을 고려하면서도 쿼리 처리 시간을 크게 줄일 수 있는가?
  • RQ2부분적 로딩을 완전 복제를 수반하는 이진 수직 분할 문제로 어떻게 모델링할 수 있으며, 이를 통해 최적화를 가능하게 할 수 있는가?
  • RQ3이중 단계 휴리스틱이 정확한 MIP 해법에 비해 훨씬 적은 시간에 거의 최적의 성능를 달성할 수 있는가?
  • RQ4데이터 접근과 추출이 동시에 일어나는 파이프라인 처리 환경에서 제안된 모델은 어떻게 성능를 발휘하는가?
  • RQ5MIP 공식화가 실세계 파이프라인 원시 데이터 처리 연산자의 실행 특성을 얼마나 정확히 반영하는가?

주요 결과

  • 제안된 이중 단계 휴리스틱은 최적의 MIP 해법에 가까운 쿼리 실행 시간을 달성하지만, 정확한 MIP 해법에 비해 훨씬 짧은 시간에 수행되어 실세계 워크로드에 실용적으로 적용 가능하다.
  • MIP 공식화가 NP-난해하고 근사가 불가능하다는 것이 증명되어, 확장 가능한 배포를 위한 휴리스틱의 사용가 타당성을 뒷받침한다.
  • SDSS 카탈로그에 대한 사례 연구에서 509개 속성 중 74개만 쿼리에 사용되었지만, 전체 복제로 인해 막대한 저장소 낭비가 발생함을 확인하여, 워크로드 인식 기반 로딩의 필요성을 강조한다.
  • CSV, FITS, JSON과 같은 실세계 데이터 포맷에서 기존 수직 분할 알고리즘보다 쿼리 처리 효율성과 확장성 면에서 뛰어난 성능를 보였다.
  • 파이프라인 처리를 위한 확장된 공식화는 동시 데이터 접근과 추출을 정확히 모델링하여, 실세계 환경에서 I/O 효율성을 향상시켰다.
  • 최신 파이프라인 연산자를 사용한 검증을 통해 모델이 저수준 실행 세부 정보를 정확히 반영함을 확인하였으며, 이는 생산 환경에서의 적용 가능성을 뒷받침한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.