Skip to main content
QUICK REVIEW

[논문 리뷰] The Data Lakehouse: Data Warehousing and More

Dipankar Mazumdar, Jason Hughes|arXiv (Cornell University)|2023. 10. 12.
Data Quality and ManagementDecision Sciences인용 수 3
한 줄 요약

이 논문은 기존 데이터 웨어하우스의 ACID 트랜잭션 기능, 구조화된 데이터 관리 및 분석 성능과 클라우드 데이터 레인지의 확장성, 오픈 포맷 및 비용 효율성의 장점을 결합한 통합 솔루션으로 데이터 레이크하우스 아키텍처를 제안한다. Apache Iceberg와 같은 오픈 테이블 포맷과 다중 엔진 컴퓨팅 레이어를 활용함으로써, 데이터 중복이나 벤더 종속성 없이 단일 통합 데이터 플랫폼에서 동시에 비즈니스 인텔리전스와 머신러닝 워크로드를 처리할 수 있다.

ABSTRACT

Relational Database Management Systems designed for Online Analytical Processing (RDBMS-OLAP) have been foundational to democratizing data and enabling analytical use cases such as business intelligence and reporting for many years. However, RDBMS-OLAP systems present some well-known challenges. They are primarily optimized only for relational workloads, lead to proliferation of data copies which can become unmanageable, and since the data is stored in proprietary formats, it can lead to vendor lock-in, restricting access to engines, tools, and capabilities beyond what the vendor offers. As the demand for data-driven decision making surges, the need for a more robust data architecture to address these challenges becomes ever more critical. Cloud data lakes have addressed some of the shortcomings of RDBMS-OLAP systems, but they present their own set of challenges. More recently, organizations have often followed a two-tier architectural approach to take advantage of both these platforms, leveraging both cloud data lakes and RDBMS-OLAP systems. However, this approach brings additional challenges, complexities, and overhead. This paper discusses how a data lakehouse, a new architectural approach, achieves the same benefits of an RDBMS-OLAP and cloud data lake combined, while also providing additional advantages. We take today's data warehousing and break it down into implementation independent components, capabilities, and practices. We then take these aspects and show how a lakehouse architecture satisfies them. Then, we go a step further and discuss what additional capabilities and benefits a lakehouse architecture provides over an RDBMS-OLAP.

연구 동기 및 목표

  • 벤더 종속성, 데이터 중복, 전용 포맷 등의 문제점을 겪는 기존 RDBMS-OLAP 시스템의 한계를 해결하기 위해.
  • ACID 트랜잭션 부족, 일관성 없는 데이터 거버넌스, 복잡한 분석 워크로드에 대한 제한된 지원 등의 문제점을 겪는 클라우드 데이터 레인지의 단점을 극복하기 위해.
  • 데이터 웨어하우징의 기능(예: 데이터 모델링, ETL/ELT, 데이터 품질)과 데이터 레인지의 확장성 및 오픈성의 기능을 통합하기 위해.
  • BI, 머신러닝, 실시간 분석과 같은 다양한 분석 워크로드를 단일 데이터 복사본에서 지원하는 단일, 오픈형, 미래 지향적인 데이터 아키텍처를 제공하기 위해.
  • 기존 데이터 웨어하우징과 동일하거나 이를 초월하는 기능을 제공하면서도 복잡성과 비용을 줄일 수 있음을 입증하기 위해.

제안 방법

  • 기술에 종속되지 않는 구성요소로 기존 데이터 웨어하우징을 분해: 기술 구성요소(예: 스토리지, 컴퓨팅), 기술 기능(예: ACID, SQL), 기술 독립적 실천(예: 데이터 모델링, ETL)으로 나누기.
  • Apache Iceberg와 같은 오픈 테이블 포맷을 사용하여 클라우드 오브젝트 스토리지(예: S3)에 저장된 데이터에서 ACID 트랜잭션, 스키마 진화, 타임트래블을 제공함으로써 레이크하우스를 구현하기.
  • 메타데이터를 관리하고 개발(Dev) 및 프로덕션(Prod) 환경에 대한 Git 유사 버전 관리를 가능하게 하는 캐탈로그 시스템(예: Project Nessie)을 통합하여 데이터 거버넌스와 격리 수준을 향상시키기.
  • Dremio Sonar와 같은 SQL 기반 분산 쿼리 엔진을 사용하여 데이터 레인지의 Iceberg 테이블에서 직접 저지연, 인터랙티브 분석을 수행할 수 있도록 하기.
  • Apache Spark와 scikit-learn에 동일한 Iceberg 테이블을 노출시켜 ETL 파이프라인이나 데이터 이동 없이도 머신러닝 워크로드를 처리할 수 있도록 하기.
  • 실시간 쿼리로 BI 대시보드를 구현하고, 동일한 데이터 소스에서 이탈 예측 모델 학습을 수행하는 통합 분석 워크플로우를 구현하여 종단 간 분석을 시연하기.
Figure 1. What is Data Warehousing?
Figure 1. What is Data Warehousing?

실험 결과

연구 질문

  • RQ1데이터 레이크하우스 아키텍처는 기존 RDBMS-OLAP 데이터 웨어하우스의 핵심 기술적 및 운영 기능을 재현할 수 있는가?
  • RQ2데이터 레이크하우스는 데이터 중복 없이 단일 통합 데이터 플랫폼에서 비즈니스 인텔리전스와 머신러닝 워크로드를 동시에 지원할 수 있는가?
  • RQ3기존 데이터 웨어하우징이나 순수한 데이터 레인지에 비해 데이터 레이크하우스는 벤더 종속성을 얼마나 줄이고 데이터 거버넌스를 얼마나 향상시키는가?
  • RQ4클라우드 네이티브이고 오픈 포맷인 데이터 레인지에서 ACID 트랜잭션과 일관된 데이터 접근을 가능하게 하는 아키텍처 패턴은 무엇인가?
  • RQ5레이크하우스의 오픈형이고 확장 가능한 성격은 향후 분석 워크로드 간의 확장성과 도구 간 상호운용성을 어떻게 지원하는가?

주요 결과

  • Apache Iceberg와 같은 오픈 테이블 포맷을 통해 데이터 레이크하우스는 ACID 트랜잭션, 스키마 진화, 타임트래블을 네이티브로 지원하여 신뢰할 수 있고 일관된 데이터 접근을 가능하게 한다.
  • Project Nessie와 같은 캐탈로그 시스템의 통합은 Git 유사 버전 관리와 환경 격리를 가능하게 하여 데이터 거버넌스와 운영 유연성을 크게 향상시킨다.
  • Dremio Sonar와 같은 SQL 엔진을 사용하면 Iceberg 테이블에서 직접 저지연, 인터랙티브 쿼리 성능을 달성할 수 있으며, 데이터 이동 없이도 BI 워크로드를 실행할 수 있다.
  • 머신러닝 파이프라인은 Apache Spark를 통해 레이크하우스에서 직접 데이터를 소비할 수 있어 ETL 파이프라인의 필요성을 제거하고 지연 시간과 엔지니어링 오버헤드를 줄인다.
  • 통합 아키텍처는 동일한 데이터 세트에서 BI와 ML 워크로드를 동시에 실행할 수 있도록 하여 데이터 중복을 줄이고 데이터 일관성을 향상시킨다.
  • 레이크하우스 아키텍처의 오픈성 덕분에 다양한 분석 엔진(예: Dremio, Spark)이 동일한 데이터에서 공존하고 상호운용할 수 있어 벤더 종속성을 줄이고 도구의 유연성을 높인다.
Figure 2. A generic representation of an RDBMS-OLAP data warehouse. Note that all the technical components are bundled into a single unit.
Figure 2. A generic representation of an RDBMS-OLAP data warehouse. Note that all the technical components are bundled into a single unit.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.