Skip to main content
QUICK REVIEW

[논문 리뷰] Adaptive Partitioning for Very Large RDF Data

Razen Harbi, Ibrahim Abdelaziz|arXiv (Cornell University)|2015. 05. 11.
Graph Theory and Algorithms참고 문헌 26인용 수 4
한 줄 요약

AdHash는 복잡한 SPARQL 쿼리에 대해 통신 비용을 최소화하고 쿼리 워크로드에 동적으로 적응하기 위해 경량의 주제 기반 해시 분할을 사용하는 분산 RDF 시스템이다. 이 시스템은 기존 시스템보다 더 낮은 시작 오버헤드와 복제 오버헤드를 기반으로 빌리언 스케일 RDF 데이터에서 밀리초 이내의 쿼리 성능을 달성한다.

ABSTRACT

Distributed RDF systems partition data across multiple computer nodes (workers). Some systems perform cheap hash partitioning, which may result in expensive query evaluation, while others apply heuristics aiming at minimizing inter-node communication during query evaluation. This requires an expensive data preprocessing phase, leading to high startup costs for very large RDF knowledge bases. Apriori knowledge of the query workload has also been used to create partitions, which however are static and do not adapt to workload changes; hence, inter-node communication cannot be consistently avoided for queries that are not favored by the initial data partitioning. In this paper, we propose AdHash, a distributed RDF system, which addresses the shortcomings of previous work. First, AdHash applies lightweight partitioning on the initial data, that distributes triples by hashing on their subjects; this renders its startup overhead low. At the same time, the locality-aware query optimizer of AdHash takes full advantage of the partitioning to (i)support the fully parallel processing of join patterns on subjects and (ii) minimize data communication for general queries by applying hash distribution of intermediate results instead of broadcasting, wherever possible. Second, AdHash monitors the data access patterns and dynamically redistributes and replicates the instances of the most frequent ones among workers. As a result, the communication cost for future queries is drastically reduced or even eliminated. To control replication, AdHash implements an eviction policy for the redistributed patterns. Our experiments with synthetic and real data verify that AdHash (i) starts faster than all existing systems, (ii) processes thousands of queries before other systems become online, and (iii) gracefully adapts to the query load, being able to evaluate queries on billion-scale RDF data in sub-seconds.

연구 동기 및 목표

  • 기존 분산 RDF 시스템이 높은 사전 처리 비용이나 정적 워크로드에 의존함으로써 발생하는 높은 시작 비용과 유연하지 못한 분할 방식을 해결하기 위해.
  • 데이터 국지성과 동적 워크로드 적응을 활용하여 일반 쿼리에 대해 브로드캐스트 대신 중간 결과의 해시 분포를 사용함으로써 쿼리 평가 중 상호작용 비용을 최소화하기 위해.
  • 복제 및 통신 오버헤드를 최소화하면서도 부하 균형을 유지함으로써 매우 큰 RDF 데이터셋에 대한 효율적이고 확장 가능한 처리를 가능하게 하기 위해.
  • 런타임 모니터링과 점진적 데이터 재분배를 통해 변화하는 쿼리 워크로드에 동적으로 적응할 수 있도록 하기 위해.

제안 방법

  • 초기 데이터 분할은 삼중항 주제에 대한 경량 해시 함수를 통해 수행되어 낮은 시작 비용과 양호한 초기 부하 균형을 보장한다.
  • 쿼리 최적화기는 일반 쿼리에 대해 브로드캐스트 대신 중간 결과의 해시 분포를 사용하여 통신을 최소화한다.
  • AdHash는 쿼리 접근 패턴을 모니터링하고 자주 실행되는 패턴(뜨거운 패턴)을 식별하여 동적 재분배를 수행한다.
  • 뜨거운 패턴은 데이터 국지성을 유지하는 해시 기반 재분배 메커니즘을 사용해 관련 워커들 간에 복제된다.
  • 저장소 오버헤드를 제어하기 위해 덜 자주 액세스되는 패턴을 제거하는 유효성 정책이 복제를 관리한다.
  • 시스템은 전체 데이터 재로드 없이도 런타임에서 뜨거운 패턴의 재분할 및 재색인을 통해 워크로드 변화에 점진적으로 적응한다.

실험 결과

연구 질문

  • RQ1복잡한 SPARQL 쿼리에 대해 통신 비용을 최소화하면서도 높은 시작 비용 없이도 분산 RDF 시스템이 작동할 수 있는가?
  • RQ2높은 복제 오버헤드 없이 동적 워크로드 적응이 대규모 RDF 시스템의 쿼리 성능을 어떻게 향상시킬 수 있는가?
  • RQ3해시 기반 분할과 런타임 패턴 재분배가 분산 RDF 쿼리 평가에서 노드 간 통신을 얼마나 줄일 수 있는가?
  • RQ4다양한 데이터 크기와 쿼리 워크로드 하에서 시스템은 부하 균형과 확장성을 어떻게 유지하는가?

주요 결과

  • AdHash는 기존 시스템보다 더 빠른 시작 속도를 보이며, 경량 초기 분할 덕분에 경쟁사가 온라인 상태가 되기 전에 수천 개의 쿼리를 처리할 수 있다.
  • 빌리언 스케일 RDF 데이터에서 AdHash는 쿼리를 밀리초 이내로 평가하여 실제 워크로드 하에서 뛰어난 성능을 입증한다.
  • 기존 시스템 대비 통신 비용과 복제 오버헤드를 줄였으며, WatDiv-1B에서는 평균 1.33%, LUBM-10240에서는 1.39%의 복제 비율을 기록했다.
  • 시스템은 뛰어난 데이터 및 작업 부하 균형을 달성했으며, 워커 간 삼중항 분포의 표준편차가 0.07 이하로 유지되어 균형 잡힌 작업 부하를 보장한다.
  • AdHash는 거의 최적의 강한 확장성을 보이며, 워커 수가 증가함에 따라 성능이 향상되며, 특히 병렬 처리 가능한 쿼리에서 두드러진다.
  • WatDiv-1B에서 QDegree 히우리스틱은 다른 히우리스틱 대비 복제를 최소화하면서도 낮은 통신 비용을 유지하여 가장 뛰어난 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.