Skip to main content
QUICK REVIEW

[논문 리뷰] Model-based Approximate Query Processing

Moritz Kulessa, Alejandro Molina|arXiv (Cornell University)|2018. 11. 15.
Advanced Database Systems and Queries참고 문헌 18인용 수 10
한 줄 요약

이 논문은 상호작용적인 데이터 탐색을 위한 빠르고 정확한 쿼리 추정을 제공하기 위해 생성 모델—특히 합-곱 네트워크(Sum-Product Networks, SPNs)—를 사용하는 새로운 접근 방식인 모델 기반 근사 쿼리 처리(Model-based Approximate Query Processing, AQP)를 소개한다. 기존의 AQP 방법이 사전 샘플링된 데이터나 온라인 샘플링에 의존하여 희귀한 부분집단에 대해 어려움을 겪는 데 반해, 모델 기반 AQP는 학습 단계에서 전체 데이터베이스의 결합 확률 분포를 학습함으로써, 희귀 그룹을 포함한 임의의 임시 쿼리에 대해 고품질의 근사 결과를 제공할 수 있으며, 대규모 데이터셋에서도 1초 이내의 응답 시간을 달성한다.

ABSTRACT

Interactive visualizations are arguably the most important tool to explore, understand and convey facts about data. In the past years, the database community has been working on different techniques for Approximate Query Processing (AQP) that aim to deliver an approximate query result given a fixed time bound to support interactive visualizations better. However, classical AQP approaches suffer from various problems that limit the applicability to support the ad-hoc exploration of a new data set: (1) Classical AQP approaches that perform online sampling can support ad-hoc exploration queries but yield low quality if executed over rare subpopulations. (2) Classical AQP approaches that rely on offline sampling can use some form of biased sampling to mitigate these problems but require a priori knowledge of the workload, which is often not realistic if users want to explore a new database. In this paper, we present a new approach to AQP called Model-based AQP that leverages generative models learned over the complete database to answer SQL queries at interactive speeds. Different from classical AQP approaches, generative models allow us to compute responses to ad-hoc queries and deliver high-quality estimates also over rare subpopulations at the same time. In our experiments with real and synthetic data sets, we show that Model-based AQP can in many scenarios return more accurate results in a shorter runtime. Furthermore, we think that our techniques of using generative models presented in this paper can not only be used for AQP in databases but also has applications for other database problems including Query Optimization as well as Data Cleaning.

연구 동기 및 목표

  • 새로운 데이터베이스에서 임시로, 상호작용적인 데이터 탐색을 지원하는 데에 있어 기존의 근사 쿼리 처리(Approximate Query Processing, AQP) 방법의 한계를 해결하기 위해.
  • 희귀 부분집단에서의 온라인 샘플링의 낮은 성능과 오프라인 샘플링 기법의 워크로드 의존성 문제를 해결하기 위해.
  • 쿼리 워크로드에 대한 사전 지식이 없이도 고품질의 저지연 응답을 제공할 수 있도록 하기 위해.
  • 특히 합-곱 네트워크(Sum-Product Networks, SPNs)를 포함한 생성 모델을 사용하여 확장 가능하고 정확한 AQP의 기반을 마련하기 위해.
  • 정확도와 성능을 유지하면서도 조인과 중첩 서브쿼리와 같은 복잡한 쿼리까지 AQP 기능을 확장하기 위해.

제안 방법

  • 사전 처리 단계 동안 전체 데이터베이스의 결합 확률 분포를 학습하기 위해 합-곱 네트워크(Sum-Product Networks, SPNs)를 활용한다.
  • 학습된 SPN을 사용하여 샘플링 없이도 단순 집계 쿼리(COUNT, AVG 등)의 확률 추정치를 직접 계산한다.
  • 복잡한 쿼리의 경우, 희귀 부분집단의 커버리지가 보장되도록 SPN에서 실시간으로 분류 샘플링을 생성한다.
  • 모델이 학습한 분포에서 샘플링을 통해 사용자 정의 함수와 복잡한 SQL 구조를 지원한다.
  • 쿼리 시점에 각 테이블의 개별 SPN을 조합하여 조인 및 중첩 쿼리의 결과를 근사한다.
  • 쿼리 근사의 불확실성을 정량화하기 위해 신뢰도 경계 추정을 시행한다.

실험 결과

연구 질문

  • RQ1SPN과 같은 생성 모델이 임시 쿼리에 대해 기존의 AQP 방법보다 더 정확하고 빠른 쿼리 근사를 제공할 수 있는가?
  • RQ2기존의 온라인 샘플링이 실패하는 희귀 부분집단에 대한 쿼리에서도 모델 기반 AQP가 높은 정확도를 유지할 수 있는가?
  • RQ3기존의 AQP 기법과 비교해 모델 기반 AQP의 런타임이 데이터 크기에 따라 어떻게 확장되는가?
  • RQ4SPN이 조인과 중첩 서브쿼리와 같은 복잡한 쿼리의 근사를 효과적으로 수행할 수 있는가?
  • RQ5SPN 모델의 품질이 AQP 결과의 정확도에 어떤 영향을 미치며, 하이브리드 모델이 성능 향상에 기여할 수 있는가?

주요 결과

  • 모델 기반 AQP는 실제 및 합성 데이터셋에서 모두 기존의 AQP 접근 방식보다 더 높은 정확도를 달성하였으며, 특히 희귀 부분집단에 대한 쿼리에서 두드러진 성능 향상을 보였다.
  • 모델 기반 AQP의 런타임은 주로 SPN의 크기에 따라 결정되며, 데이터 크기와는 무관하여 대규모 데이터베이스에서도 1초 이내의 응답 시간을 확보할 수 있었다.
  • 이 방법은 실시간으로 분류 샘플링을 생성하여, 기존의 온라인 샘플링이 실패하는 희귀 부분집단에 대해서도 신뢰할 수 있는 추정치를 보장하였다.
  • SPN은 단순 집계에 대한 직접적인 확률 추정과 복잡한 쿼리에 대한 샘플 생성을 가능하게 하여 다양한 SQL 연산을 지원하였다.
  • 이 접근 방식은 신뢰도 경계 추정을 지원하여 사용자가 근사 결과의 신뢰성을 평가할 수 있도록 하였다.
  • 초기 결과에 따르면, 모델과 원본 데이터를 조합한 하이브리드 SPN은 강한 속성 상관관계를 유지함으로써 정확도를 추가로 향상시킬 수 있었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.