Skip to main content
QUICK REVIEW

[논문 리뷰] PushdownDB: Accelerating a DBMS using S3 Computation

Xiangyao Yu, Matt Youill|arXiv (Cornell University)|2020. 02. 14.
Cloud Computing and Resource Management참고 문헌 26인용 수 4
한 줄 요약

PushdownDB는 AWS S3의 S3 Select를 사용하여 선택적 연산—필터, 프로젝션, 집계, 조인, 그룹화, 상위-K—을 데이터베이스 쿼리 처리에 통합함으로써 TPC-H 벤치마크 전반에서 평균적으로 쿼리 실행 시간을 6.7배 빠르게 하고 비용을 30% 감소시켜, S3 기반 계산이 클라우드 네이티브 분석 워크로드를 효과적으로 가속화할 수 있음을 입증한다.

ABSTRACT

This paper studies the effectiveness of pushing parts of DBMS analytics queries into the Simple Storage Service (S3) engine of Amazon Web Services (AWS), using a recently released capability called S3 Select. We show that some DBMS primitives (filter, projection, aggregation) can always be cost-effectively moved into S3. Other more complex operations (join, top-K, group-by) require reimplementation to take advantage of S3 Select and are often candidates for pushdown. We demonstrate these capabilities through experimentation using a new DBMS that we developed, PushdownDB. Experimentation with a collection of queries including TPC-H queries shows that PushdownDB is on average 30% cheaper and 6.7X faster than a baseline that does not use S3 Select.

연구 동기 및 목표

  • S3 Select를 사용해 AWS S3에 데이터베이스 연산을 프로젝션하는 것의 실현 가능성과 성능 이점을 평가하는 것.
  • 필터, 조인, 그룹화와 같은 DBMS 연산자 중 S3 계산을 통해 효과적으로 가속화할 수 있는 연산자를 특정하는 것.
  • 복잡한 연산자에 대해 S3 기반 계산 프로젝션을 네이티브로 지원하는 새로운 DBMS인 PushdownDB를 설계하고 구현하는 것.
  • 분리된 클라우드 아키텍처에서 전통적인 EC2 내 처리 대비 비용 및 성능 향상을 정량화하는 것.
  • 현재 S3 Select 인터페이스의 한계를 파악하고 향후 데이터베이스 시스템을 위한 향상 방안을 제안하는 것.

제안 방법

  • S3 Select를 통한 필터, 프로젝션, 집계 및 조인, 그룹화, 상위-K와 같은 복잡한 연산자에 대한 프로젝션을 지원하는 새로운 DBMS인 PushdownDB를 구현하였다.
  • 각 연산자에 맞는 맞춤형 프로젝션 로직을 설계하여 SQL 연산을 S3 Select 호환 표현식으로 매핑하고 데이터 전송을 최소화하였다.
  • S3에서 수치적 조건 프로젝션과 컬럼 제거를 최적화하기 위해 기반 스토리지 포맷으로 Parquet를 사용하였다.
  • 마이크로벤치마크와 TPC-H 쿼리를 실행하여 기준 EC2 전용 실행 모델 대비 성능과 비용을 비교하였다.
  • AWS 청구 및 모니터링 도구를 사용해 런타임과 비용을 측정하여 종단 간 성능 및 경제적 효율성을 평가하였다.
  • 더 복잡한 연산자 지원 및 데이터베이스 워크로드에 대한 사용성 향상을 위해 S3 Select의 아키텍처 확장을 제안하였다.

실험 결과

연구 질문

  • RQ1S3 Select를 사용해 어떤 DBMS 연산자가 효과적으로 S3에 프로젝션될 수 있으며, 이러한 프로젝션은 어떤 조건에서 비용 효율적인가?
  • RQ2S3 Select를 통한 계산 프로젝션은 조인, 그룹화, 상위-K와 같은 복잡한 연산자의 쿼리 성능과 비용에 어떻게 영향을 미치는가?
  • RQ3분리된 클라우드 스토리지 아키텍처에서 S3 Select는 데이터 전송을 얼마나 줄이고 런타임을 얼마나 향상시킬 수 있는가?
  • RQ4분석 워크로드에서 EC2에서 실행하는 것과 S3에서 실행하는 것 사이의 성능 및 비용 트레이드오���은 어떠한가?
  • RQ5현재 S3 Select 인터페이스는 어떻게 확장되어야 하며, 어떤 방식으로 더 복잡한 데이터베이스 연산을 확장 가능하고 효율적으로 지원할 수 있는가?

주요 결과

  • PushdownDB는 TPC-H 쿼리의 일부에 대해 기준 EC2 전용 실행 모델 대비 평균적으로 6.7배 빠른 성능 향상을 달성하였다.
  • 데이터 전송을 최소화하고 S3 Select의 가격 모델을 활용함으로써 전체 쿼리 비용을 평균적으로 30% 감소시켰다.
  • 필터, 프로젝션, 집계와 같은 간단한 연산자는 낮은 S3 Select 비용과 높은 데이터 감소 비율로 인해 항상 비용 효율적이었다.
  • 조인, 그룹화, 상위-K와 같은 복잡한 연산자는 맞춤형 재구현이 필요했지만, S3로 프로젝션된 경우에도 여전히 뚜렷한 성능 및 비용 이점이 있었다.
  • Parquet 열 기반 스토리지 포맷은 S3에서 효율적인 조건 프로젝션과 컬럼 제거를 가능하게 하여 성능 향상에 기여했다.
  • 본 연구는 현재 S3 Select 인터페이스의 한계를 드러내었으며, 복잡한 데이터 유형 및 연산자에 대한 지원 부족으로 인해 향후 개선이 필요하다는 점을 밝혀냈다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.