Skip to main content
QUICK REVIEW

[논문 리뷰] Data Mining-based Materialized View and Index Selection in Data Warehouses

Kamel Aouiche, Jérôme Darmont|ArXiv.org|2007. 07. 11.
Data Mining Algorithms and Applications참고 문헌 54인용 수 4
한 줄 요약

이 논문은 데이터 웨어하우스에서 쿼리 성능을 최적화하면서 스토리지 오버헤드와 유지보수 비용을 최소화하기 위해 데이터 마이닝 기반 접근법을 제안한다. 고가치 후보를 식별하고, 뷰-인덱스 상호작용을 고려한 비용 모델을 활용함으로써, 독립적 선택 대비 최대 30% 향상된 성능을 달성하며, 특히 중간에서 대규모 스토리지 제약 조건 하에서 유의미하다.

ABSTRACT

Materialized views and indexes are physical structures for accelerating data access that are casually used in data warehouses. However, these data structures generate some maintenance overhead. They also share the same storage space. Most existing studies about materialized view and index selection consider these structures separately. In this paper, we adopt the opposite stance and couple materialized view and index selection to take view-index interactions into account and achieve efficient storage space sharing. Candidate materialized views and indexes are selected through a data mining process. We also exploit cost models that evaluate the respective benefit of indexing and view materialization, and help select a relevant configuration of indexes and materialized views among the candidates. Experimental results show that our strategy performs better than an independent selection of materialized views and indexes.

연구 동기 및 목표

  • 데이터 웨어하우스에서 물리적 설계의 스케일러빌리티와 복잡성을 해결하기 위해.
  • 기존 방법들이 뷰와 인덱스 선택을 별도로 다루며 상호작용을 忽略하는 한계를 극복하기 위해.
  • 관련된 후보 뷰와 인덱스를 식별하는 데이터 마이닝 기법을 통해 선택 문제의 차원을 감소시키기 위해.
  • 결합된 뷰와 인덱스 구성의 성능 향상 대비 유지보수 오버헤드를 평가하는 비용 모델을 개발하기 위해.
  • 통합된 뷰-인덱스 선택을 통해 최적의 스토리지 공간 공유와 쿼리 응답 시간 향상을 달성하기 위해.

제안 방법

  • 대표적인 쿼리 워크로드에 대해 빈도 기반 항목집합 마이닝을 적용하여, 축소되고 관련성 있는 후보 뷰와 인덱스 세트를 생성하기 위해 데이터 마이닝 기법을 사용한다.
  • 각 후보 구성의 이득 대 오버헤드 비율을 평가하기 위해 비용 모델을 사용하며, 뷰와 인덱스 간의 상호작용을 포함한다.
  • 제약 조건이 있는 최적화 문제로 공동 선택 문제를 공식화한다: 스토리지 공간 제한 S 내에서 쿼리 실행 비용을 최소화한다.
  • 뷰-인덱스 상호작용을 비용 모델에 통합하여, 물리적 뷰에 인덱스를 적용할 경우 유지보수 비용 감소 또는 쿼리 성능 향상이 가능하다는 점을 인지한다.
  • 고립된 뷰 선택, 고립된 인덱스 선택, 공동 선택의 세 가지 시나리오에 적용하며, 후자가 주요 기여이다.
  • 실험에서 스토리지 공간 할당(S/S_VI)에 따라 성능을 시각화하기 위해 로그 스케일을 사용한다.

실험 결과

연구 질문

  • RQ1어떻게 데이터 마이닝 기법을 효과적으로 활용하여 데이터 웨어하우스에서 뷰와 인덱스 후보의 검색 공간을 축소할 수 있는가?
  • RQ2뷰-인덱스 상호작용은 물리적 설계 구성의 전체 성능과 스토리지 효율성에 어떤 영향을 미치는가?
  • RQ3쿼리 응답 시간과 스토리지 활용도 측면에서 공동 선택이 독립적 선택보다 어떻게 다를 수 있는가?
  • RQ4어떤 스토리지 공간 제약 조건에서 공동 선택이 뷰 또는 인덱스의 고립된 선택보다 더 효과적인가?
  • RQ5다양한 DBMS 플랫폼을 지원하고 클러스터링이나 파artitioning과 같은 다른 물리적 설계 기법으로 확장 가능한 일반적이고 모듈러한 접근법을 설계할 수 있는가?

주요 결과

  • 공동 선택은 스토리지 공간이 중간에서 대규모일 경우, 독립적 선택 대비 최대 30% 향상된 쿼리 응답 시간을 달성하였다.
  • 제안된 방법은 평균적으로 후보 인덱스 수를 약 40% 감소시켰으며, 유사한 성능를 유지하면서 유지보수 오버헤드를 크게 낮췄다.
  • 스토리지 공간이 심각하게 제약받을 경우, 뷰보다 인덱스가 더 작기 때문에 고립된 인덱스 선택이 공동 선택을 능가했다.
  • 비용 모델은 뷰-인덱스 상호작용을 효과적으로 반영하여, 별도 최적화에서 유도된 구성보다 더 효율적인 구성으로 이어졌다.
  • 이 접근법은 확장성과 모ularity를 입증하였으며, 데이터 마이닝 및 비용 모델 구성 요소를 다른 기법으로 교체함으로써 확장 가능성을 제공하였다.
  • 오라클 기반 시스템에서의 실험 결과는 이 방법의 효과성을 확인하였지만, 기업 내부 및 재사용 불가능한 구현으로 인해 기존 시스템과의 직접 비교는 제한적이었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.