Skip to main content
QUICK REVIEW

[논문 리뷰] gSMat: A Scalable Sparse Matrix-based Join for SPARQL Query Processing

Xiaowang Zhang, Mingyue Zhang|arXiv (Cornell University)|2018. 07. 20.
Graph Theory and Algorithms참고 문헌 33인용 수 4
한 줄 요약

이 논문은 대규모 RDF 데이터셋에서 SPARQL 쿼리 처리를 위한 확장 가능한 희소 행렬 기반 접근법인 gSMat을 제안한다. 각 문맥을 별도의 희소 행렬로 모델링하고 조인 연산에 행렬 곱셈을 활용함으로써, 높은 효율성과 확장성을 달성한다. 실제 데이터셋에서 gStore 대비 최대 114배, RDF-3X 대비 최대 53배의 성능 향상을 기록하며, CUDA를 통한 GPU 가속 기능으로 더욱 뛰어난 성능을 발휘한다.

ABSTRACT

Resource Description Framework (RDF) has been widely used to represent information on the web, while SPARQL is a standard query language to manipulate RDF data. Given a SPARQL query, there often exist many joins which are the bottlenecks of efficiency of query processing. Besides, the real RDF datasets often reveal strong data sparsity, which indicates that a resource often only relates to a few resources even the number of total resources is large. In this paper, we propose a sparse matrix-based (SM-based) SPARQL query processing approach over RDF datasets which con- siders both join optimization and data sparsity. Firstly, we present a SM-based storage for RDF datasets to lift the storage efficiency, where valid edges are stored only, and then introduce a predicate- based hash index on the storage. Secondly, we develop a scalable SM-based join algorithm for SPARQL query processing. Finally, we analyze the overall cost by accumulating all intermediate results and design a query plan generated algorithm. Besides, we extend our SM-based join algorithm on GPU for parallelizing SPARQL query processing. We have evaluated our approach compared with the state-of-the-art RDF engines over benchmark RDF datasets and the experimental results show that our proposal can significantly improve SPARQL query processing with high scalability.

연구 동기 및 목표

  • 대규모이고 희소한 RDF 데이터에서 효율적이지 못한 조인으로 인한 SPARQL 쿼리 처리 성능 저하 문제를 해결한다.
  • 실제 RDF 데이터셋(예: DBpedia, YAGO)의 본질적 희소성 특성을 활용해 더 컴act하고 효율적인 스토리지 모델을 설계한다.
  • 데이터의 희소성을 활용하고 고도로 병렬화 가능한 효율적인 쿼리 실행을 가능하게 하는 행렬 기반 조인 알고리즘을 개발한다.
  • 중간 결과 크기를 기반으로 비용 추정을 수행하여 쿼리 실행 계획을 최적화함으로써 성능을 향상시킨다.
  • 대규모 워크로드에서의 확장성과 성능 향상을 위해 GPU 가속을 통한 확장된 접근법을 제공한다.

제안 방법

  • 각 RDF 문맥을 희소 행렬로 표현하여 비영(유효한) 엣지만 저장함으로써 데이터의 희소성을 활용하고 스토리지 오버헤드를 줄인다.
  • 희소 행렬 스토리지에 문맥 기반 해시 인덱스를 적용하여 액세스 및 조인 연산을 가속화한다.
  • SPARQL 기본 그래프 패턴(BGPs)을 행렬 곱셈의 연속으로 모델링하며, 각 삼중항 패턴이 하나의 행렬에 대응한다.
  • 행렬 곱셈을 통해 관계 간 자연 조인을 계산함으로써 행렬 요소 수준의 세밀한 병렬성을 실현한다.
  • 중간 결과 크기를 추정하고 최적의 조인 순서를 선택하여 전체 실행 비용을 최소화하는 비용 기반 쿼리 계획 생성기 설계.
  • 현대 하드웨어에서의 쿼리 처리를 가속화하기 위해 CUDA를 활용한 GPU 최적화 버전을 구현한다.

실험 결과

연구 질문

  • RQ1희소 행렬 표현 방식을 효과적으로 활용하여 대규모이고 희소한 RDF 데이터셋을 고효율 스토리지와 높은 쿼리 성능로 모델링하고 저장할 수 있는가?
  • RQ2희소 행렬에 대한 행렬 곱셈 연산이 기존 조인 알고리즘에 비해 확장 가능하고 효율적인 SPARQL 쿼리 처리의 대안이 될 수 있는가?
  • RQ3중간 결과 추정 기반의 비용 기반 쿼리 최적화 통합이 SPARQL 쿼리 실행 성능에 어떻게 기여하는가?
  • RQ4GPU 가속이 대규모 RDF 워크로드에서 희소 행렬 기반 SPARQL 조인의 성능에 얼마나 큰 기여를 하는가?
  • RQ5실제 데이터셋에서 최신 기술 수준의 RDF 시스템인 gStore 및 RDF-3X와 비교해 gSMat 접근법의 성능 및 확장성은 어떠한가?

주요 결과

  • 5억 개 삼중항을 포함한 벤치마크 데이터셋에서 gSMat는 gStore 대비 최대 114배, RDF-3X 대비 최대 11.3배의 성능 향상을 기록한다.
  • 실제 데이터셋에서 복잡한 SPARQL 쿼리에 대해 gSMat는 gStore 대비 최대 46.4배, RDF-3X 대비 최대 33.6배의 성능 향상을 달성한다.
  • GPU 가속 버전인 gSMat+는 벤치마크 데이터에서 gStore 대비 최대 128.8배, RDF-3X 대비 최대 16.13배의 성능 향상을 기록한다.
  • 실제 데이터셋에서 gSMat+는 gStore 대비 최대 78.9배, RDF-3X 대비 최대 53.0배의 성능 향상을 기록하여 생산 워크로드에서 강력한 확장성을 입증한다.
  • 비용 기반 쿼리 계획 생성기는 중간 결과 크기를 크게 줄여서 난이도 높은 조인 순서보다 더 효율적인 실행 계획을 도출한다.
  • 희소 행렬 기반 스토리지 구조는 메모리 사용량을 감소시키고 효율적이고 초고도로 병렬화 가능한 계산을 가능하게 하여 대규모 RDF 데이터 처리에 매우 적합하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.