Skip to main content
QUICK REVIEW

[논문 리뷰] In-Depth Benchmarking of Graph Database Systems with the Linked Data Benchmark Council (LDBC) Social Network Benchmark (SNB)

Florin Rusu, Zhiyi Huang|arXiv (Cornell University)|2019. 07. 17.
Graph Theory and Algorithms참고 문헌 12인용 수 4
한 줄 요약

이 논문은 LDBC 소셜 네트워크 벤치마크(SNB)를 사용하여 온프레미스 및 클라우드 아키텍처에서 스케일 팩터 SF-1에서 SF-1000까지 46개의 쿼리에서 성능을 평가하는 포괄적이고 재현 가능한 벤치마크를 제시한다. 티거그래프는 대부분의 쿼리에서 네오4재이를 2개 이상의 주기수 이상 뛰어넘으며, 특히 복잡한 작업 및 비즈니스 인텔리전스 워크로드에서 뛰어난 성능을 보이며, SF-1000까지 우수한 확장성을 보이고, 저장소 용량을 4배 줄였다. 반면 네오4재이는 SF-100까지는 원시 데이터 로딩 속도에서 빠르지만, 색인 구축 속도가 느려 전체 로딩 시간이 SF-1000에서 2배 느려진다.

ABSTRACT

In this study, we present the first results of a complete implementation of the LDBC SNB benchmark -- interactive short, interactive complex, and business intelligence -- in two native graph database systems---Neo4j and TigerGraph. In addition to thoroughly evaluating the performance of all of the 46 queries in the benchmark on four scale factors -- SF-1, SF-10, SF-100, and SF-1000 -- and three computing architectures -- on premise and in the cloud -- we also measure the bulk loading time and storage size. Our results show that TigerGraph is consistently outperforming Neo4j on the majority of the queries---by two or more orders of magnitude (100X factor) on certain interactive complex and business intelligence queries. The gap increases with the size of the data since only TigerGraph is able to scale to SF-1000---Neo4j finishes only 12 of the 25 business intelligence queries in reasonable time. Nonetheless, Neo4j is generally faster at bulk loading graph data up to SF-100. A key to our study is the active involvement of the vendors in the tuning of their platforms. In order to encourage reproducibility, we make all the code, scripts, and configuration parameters publicly available online.

연구 동기 및 목표

  • LDBC SNB 벤치마크를 사용하여 네이티브 그래프 데이터베이스 시스템을 포괄적이고 재현 가능한 평가를 제공하기 위해.
  • SF-1에서 SF-1000까지의 스케일 팩터에서 인터랙티브, 복잡, 비즈니스 인텔리전스 워크로드에 걸쳐 네오4재이와 티거그래프의 성능을 비교하기 위해.
  • 온프레미스 및 클라우드 배포 환경에서 일괄 로딩 시간, 저장소 효율성, 쿼리 실행 성능을 측정하고 대조하기 위해.
  • 모든 코드, 스크립트, 설정을 공개하여 재현 가능성을 확보하고, 시스템 벤더의 쿼리 최적화 참여를 통해 결과의 신뢰성을 높이기 위해.
  • 향후 벤치마킹을 위한 모든 46개의 LDBC SNB 쿼리에 대한 Cypher 및 GSQL 기반 참조 구현을 수립하기 위해.

제안 방법

  • 네오4재이(Cypher)와 티거그래프(GSQL)에서 모두 46개의 LDBC SNB 쿼리를 완전히 구현하고, 벤더 가이드라인에 따라 최적화를 수행하였다.
  • 온프레미스 및 두 개의 클라우드 환경을 포함한 세 가지 컴퓨팅 아키텍처에서 SF-1, SF-10, SF-100, SF-1000의 네 가지 스케일 팩터에서 모든 쿼리를 실행하였다.
  • 두 시스템의 쿼리 실행 시간, 일괄 로딩 시간, 저장소 크기(원시 및 색인)를 측정하였다.
  • 공식 LDBC SNB 데이터 생성기를 사용하여 현실적인 스키마와 분포를 가진 합성 소셜 네트워크 데이터를 생성하였다.
  • 비가용성 성능을 식별하기 위해 타임아웃 임계값(18,000초)을 적용하였다.
  • 모든 쿼리 스크립트, 설정 파일, 벤치마킹 코드를 공개하여 재현 가능성을 확보하였다.

실험 결과

연구 질문

  • RQ1네오4재이와 티거그래프는 SF-1에서 SF-1000까지의 다양한 스케일 팩터에서 LDBC SNB 워크로드 전반—인터랙티브 단순, 인터랙티브 복잡, 비즈니스 인텔리전스—에서 어떻게 성능을 발휘하는가?
  • RQ2쿼리 실행 시간, 일괄 로딩, 저장소 효율성 측면에서 네오4재이와 티거그래프의 상대적 성능은 어떠한가?
  • RQ3각 시스템은 얼마나 큰 규모의 데이터(SF-1000)까지 확장할 수 있으며, 성능 저하 요인은 무엇인가?
  • RQ4벤더 최적화 쿼리 계획의 포함 여부가 벤치마킹 결과와 재현 가능성에 어떤 영향을 미치는가?
  • RQ5네이티브 그래프 데이터베이스에서 쿼리 성능, 데이터 로딩 속도, 저장소 크기 사이의 상호 교환 관계는 어떠한가?

주요 결과

  • 티거그래프는 368개의 벤치마크 구성 중 96.5%에서 네오4재이를 앞서며, 95% 이상의 워크로드에서 뛰어난 성능을 보였다.
  • 일부 인터랙티브 복잡 및 비즈니스 인텔리전스 쿼리에서 티거그래프는 100배 이상 더 빠른 실행 속도를 기록했으며, 스케일 팩터가 커질수록 성능 격차가 커졌다.
  • SF-1000까지 유일하게 성공적으로 확장한 것은 티거그래프였으며, 네오4재이는 18,000초 타임아웃 내에 25개의 비즈니스 인텔리전스 쿼리 중 13개를 완료하지 못했다.
  • 티거그래프는 네오4재이 대비 원시 저장소 용량을 3배, 색인 저장소 용량을 4배 줄였으며, 원본 데이터를 2배 압축했다.
  • 네오4재이는 원시 데이터 일괄 로딩 속도에서 더 빠르며(SF-1 기준 최대 3배 빠름), 그러나 색인 구축이 비가용성으로 인해 SF-1000에서 총 로딩 시간이 2배 느려졌다.
  • 더 컴act한 문법을 가졌음에도 불구하고, 네오4재이의 쿼리 실행은 거의 모든 워크로드에서 티거그래프에 뒤지며, 쿼리 처리에서의 아키텍처적 우수성을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.