Skip to main content
QUICK REVIEW

[논문 리뷰] ML-AQP: Query-Driven Approximate Query Processing based on Machine Learning

Fotis Savva, Christos‐Nikolaos Anagnostopoulos|arXiv (Cornell University)|2020. 03. 14.
Data Quality and Management인용 수 6
한 줄 요약

ML-AQP는 기존에 실행된 쿼리와 그 결과만을 사용하여 데이터 접근 없이 약간의 집계 쿼리 결과를 예측하는 경량의, 쿼리 중심의 기계학습 시스템을 제안한다. 벡터화된 쿼리 표현을 기반으로 작고 효율적인 모델을 훈련하고 예측 간격을 제공함으로써, 정확도가 높은 결과를 얻으면서도 최대 5개 지수 정도의 빠른 응답 시간을 달성한다.

ABSTRACT

As more and more organizations rely on data-driven decision making, large-scale analytics become increasingly important. However, an analyst is often stuck waiting for an exact result. As such, organizations turn to Cloud providers that have infrastructure for efficiently analyzing large quantities of data. But, with increasing costs, organizations have to optimize their usage. Having a cheap alternative that provides speed and efficiency will go a long way. Concretely, we offer a solution that can provide approximate answers to aggregate queries, relying on Machine Learning (ML), which is able to work alongside Cloud systems. Our developed lightweight ML-led system can be stored on an analyst's local machine or deployed as a service to instantly answer analytic queries, having low response times and monetary/computational costs and energy footprint. To accomplish this we leverage the knowledge obtained by previously answered queries and build ML models that can estimate the result of new queries in an efficient and inexpensive manner. The capabilities of our system are demonstrated using extensive evaluation with both real and synthetic datasets/workloads and well known benchmarks.

연구 동기 및 목표

  • 클라우드 기반 데이터 웨어하우스에서 정확한 쿼리 처리의 높은 비용과 지연을 해결하기 위해 빠르고 근사적인 결과를 제공하는 것.
  • 탐색적 데이터 분석 중에 비용이 많이 드는 클라우드 인프라에 의존도를 줄이기 위해 계산을 현지에서 이동시키는 것.
  • 모든 집계 함수, 특히 기존 AQP 방법에서 잘 처리되지 않는 MIN 및 MAX를 포함하여 경량이고 저자원 소비 시스템을 제공하는 것.
  • 데이터나 쿼리 워크로드가 변화함에 따라 예측 신뢰성을 보장하기 위해 분위수 회귀를 통해 오차 경계를 제공하는 것.
  • 훈련 또는 추론 중에 데이터 접근이 필요 없도록 하여 시스템의 개인정보 보호성과 효율성을 확보하는 것.

제안 방법

  • 쿼리가 그 구조와 필터링 조건을 반영하는 고유한 벡터화된 표현으로 변환된다.
  • 과거 쿼리-결과 쌍을 기반으로 기계학습 모델이 훈련되어 쿼리 패tern에서 집계 결과로의 매핑을 학습한다.
  • 낮은 메모리 사용량과 빠른 훈련을 보장하기 위해 간단하고 해석 가능한 모델(예: 선형 모델)을 사용한다.
  • 예측 간격은 분위수 회귀를 통해 구성되어 근사 결과의 오차 보장을 제공한다.
  • 재훈련 없이도 데이터 및 쿼리 워크로드의 증분적 업데이트를 지원한다.
  • 이 접근법은 AF-무관하므로, SUM, AVG, COUNT, MIN, MAX를 포함한 모든 집계 함수를 지원할 수 있다.

실험 결과

연구 질문

  • RQ1과거 쿼리-결과 쌍만으로 훈련된 기계학습 시스템이 기반 데이터에 접근하지 않고도 빠르고 정확한 근사 결과를 제공할 수 있는가?
  • RQ2기존 AQP 엔진과 비교해 볼 때, 이러한 시스템의 성능은 속도, 정확도, 자원 사용 측면에서 어떻게 다른가?
  • RQ3데이터나 쿼리 워크로드가 시간이 지남에 따라 변화해도 정확도와 낮은 오차 경계를 유지할 수 있는가?
  • RQ4기계학습 기반 AQP에서 어려운 것으로 간주되는 MIN 및 MAX를 포함한 다양한 집계 함수에 대해 얼마나 잘 일반화되는가?
  • RQ5이 쿼리 중심의 접근 방식은 데이터 기반 기계학습 기반 AQP 시스템에 비해 훈련 및 추론 오버헤드에서 어떤가?

주요 결과

  • ML-AQP는 정확한 처리 방식에 비해 쿼리 응답 시간에서 최대 5개 지수 정도의 성능 향상을 달성했으며, 계산 비용은 최소한이다.
  • BK-Austin 데이터셋에서 ML-AQP는 상대 절대 오차(Relative Absolute Error, RAE) 3.9%를 기록했으며, 더 단순한 모델을 사용했음에도 불구하고 NeuralCubes(3.88%)를 略로 뛰어넘었다.
  • BK-NYC 데이터셋에서 ML-AQP는 RAE 3.6%를 기록했으며, NeuralCubes(4.25%)를 뛰어넘어 유사한 조건에서 뛰어난 정확도를 보였다.
  • ML-AQP는 더 약한 하드웨어에서도 NeuralCubes보다 10배 이상 빠르게 모델을 훈련할 수 있었으며, 이는 경량의 쿼리 중심 접근 방식 덕분이었다.
  • 이 시스템은 기존 AQP 기법에서 잘 다루지 못하는 MIN 및 MAX를 포함한 모든 집계 함수를 지원한다.
  • 분위수 회귀를 통해 생성된 예측 간격은 신뢰할 수 있는 오차 경계를 제공하여 사용자가 근사 결과의 정확도를 판단하는 데 도움이 된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.