Skip to main content
QUICK REVIEW

[논문 리뷰] Graph or Relational Databases: A Speed Comparison for Process Mining Algorithm

Jeevan Joishi, Ashish Sureka|arXiv (Cornell University)|2016. 12. 31.
Service-Oriented Architecture and Web Services참고 문헌 1인용 수 7
한 줄 요약

이 논문은 프로세스 마이닝에서 사용되는 조직 마이닝 알고리즘인 Similar-Task와 Sub-Contract를 구현하기 위해 관계형(예: MySQL)과 그래프(예: Neo4j) 데이터베이스의 성능을 비교한다. 관계 중심 작업인 서브컨트랙트 탐지와 같은 작업에서는 Neo4j가 MySQL보다 최대 7배 빠른 쿼리 실행 성능을 보이며, MySQL은 쓰기 작업과 유사도 계산에서 빠르며, Neo4j는 I/O 효율성과 캐싱 측면에서 뛰어나다.

ABSTRACT

Process-Aware Information System (PAIS) are IT systems that manages, supports business processes and generate large event logs from execution of business processes. An event log is represented as a tuple of the form CaseID, TimeStamp, Activity and Actor. Process Mining is an emerging area of research that deals with the study and analysis of business processes based on event logs. Process Mining aims at analyzing event logs and discover business process models, enhance them or check for conformance with an a priori model. The large volume of event logs generated are stored in databases. Relational databases perform well for certain class of applications. However, there are certain class of applications for which relational databases are not able to scale. A number of NoSQL databases have emerged to encounter the challenges of scalability. Discovering social network from event logs is one of the most challenging and important Process Mining task. Similar-Task and Sub-Contract algorithms are some of the most widely used Organizational Mining techniques. Our objective is to investigate which of the databases (Relational or Graph) perform better for Organizational Mining under Process Mining. An intersection of Process Mining and Graph Databases can be accomplished by modelling these Organizational Mining metrics with graph databases. We implement Similar-Task and Sub-Contract algorithms on relational and NoSQL (graph-oriented) databases using only query language constructs. We conduct empirical analysis on a large real world data set to compare the performance of row-oriented database and NoSQL graph-oriented database. We benchmark performance factors like query execution time, CPU usage and disk/memory space usage for NoSQL graph-oriented database against row-oriented database.

연구 동기 및 목표

  • 유사 작업 알고리즘과 서브컨트랙트 알고리즘을 표준 SQL 문법을 사용하여 행 중심의 관계형 데이터베이스(예: MySQL)에서 어떻게 구현할 수 있는지 조사하기.
  • 이러한 알고리즘들이 그래프 중심의 데이터베이스(예: Neo4j)에서 네이티브 CYPHER 쿼리로 어떻게 적응되는지 검토하기.
  • 쿼리 실행 시간, CPU 사용률, 디스크 I/O, 메모리 사용량을 기준으로 두 데이터베이스의 성능을 실험적으로 벤치마킹하고 비교하기.
  • 실제 프로세스 마이닝 워크로드에서 일반적인 실세계 데이터 워크로드 하에서 두 시스템의 확장성과 효율성 평가하기.
  • 특히 관계 탐색 대비 계산 중심 작업에 따라 최적의 데이터베이스 선택 기준 도출하기.

제안 방법

  • 표준 SQL 쿼리와 고급 저장 프로시저를 사용하여 MySQL에서 유사 작업 알고리즘을 구현하고, 이를 단일 계층 애플리케이션으로 간주하기.
  • 네이티브 CYPHER 쿼리 언어를 사용하여 Neo4j에서 유사 작업 알고리즘을 구현하고, 그래프 네이티브 탐색 기능을 활용하기.
  • 두 데이터베이스에서 각각 SQL과 CYPHER를 사용하여 서브컨트랙트 알고리즘을 구현하여 공정한 비교 확보하기.
  • 모든 데이터베이스에서 메모이제이션 기능을 갖춘 자바 API를 사용하여 메모리 내 계산 워크로드 하에서 성능 평가하기.
  • 대규모 실세계 이벤트 로그 데이터셋을 대상으로 실험을 수행하고, 쿼리 실행 시간, CPU 사용률, 디스크 I/O, 메모리 사용량, 페이지 터널 수를 측정하기.
  • 시스템 모니터링 도구(예: 성능 모니터)를 활용하여 두 데이터베이스 시스템 간의 저수준 자원 메트릭 비교 수집하기.

실험 결과

연구 질문

  • RQ1쿼리 실행 시간과 자원 사용량 측면에서 MySQL과 Neo4j 간의 유사 작업 알고리즘 성능은 어떻게 비교되는가?
  • RQ2서브컨트랙트 알고리즘은 Neo4j에서 MySQL에 비해 어떻게 작동하는가? 특히 액터 관계 탐색에서의 성능은?
  • RQ3대규모 데이터 처리 중에 MySQL과 Neo4j 중 어느 데이터베이스 시스템이 더 뛰어난 I/O 효율성과 캐싱 행동을 보이는가?
  • RQ4이벤트 로그 데이터의 인gest 및 저장에 대해 MySQL과 Neo4j의 상대적 쓰기 성능 특성은 어떻게 다른가?
  • RQ5동일한 데이터셋과 알고리즘을 사용할 때 MySQL 테이블과 Neo4j 그래프 요소 간 디스크 공간 요구량은 어떻게 다를까?

주요 결과

  • 유일한 요소만 생성할 경우, Neo4j는 MySQL보다 1.25배 더 빠른 대용량 데이터셋 로딩 성능을 보이며, 중복 최소화된 데이터 인게스트에서 뛰어난 성능을 나타낸다.
  • MySQL은 쓰기 작업에서 Neo4j보다 1.5배 더 빠르며, 데이터 삽입 및 업데이트 워크로드에서 뛰어난 성능을 보인다.
  • 유사 작업 알고리즘의 유사도 계산은 MySQL에서 Neo4j보다 32배 더 빠르며, MySQL의 계산 중심 작업에서의 강점을 보여준다.
  • 서브컨트랙팅 액터를 탐지하기 위해 관계를 탐색하는 데에는 Neo4j가 MySQL보다 7배 더 빠르며, Neo4j의 관계 집약형 쿼리에서의 우수성을 입증한다.
  • Neo4j는 캐싱 효율성이 18배 높고, 디스크 I/O 연산 수가 MySQL보다 6배 적으며, 디스크 작업에 소요되는 시간이 10배 적다.
  • 인덱스 없는 연결성과 속성 저장으로 인한 더 높은 디스크 사용에도 불구하고, 고유한 그래프 요소에 대해서는 Neo4j가 MySQL보다 12배 더 적은 디스크 공간을 사용하지만, 중복 요소가 많은 데이터셋에서는 30배 이상 더 많은 디스크 공간을 사용한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.