[논문 리뷰] MIRAGE: An Iterative MapReduce based FrequentSubgraph Mining Algorithm
MiRage는 클러스터를 통해 계산을 분산시켜 대규모 그래프 데이터세트에 효과적으로 확장 가능한, 완전하고 반복적인 MapReduce 기반의 빈도 높은 부분그래프 탐사 알고리즘입니다. 반복적인 상태 전파와 최적화된 분할 전략을 통해 MapReduce 반복 단계에서 상태를 효율적으로 관리함으로써, 사용자가 정의한 지원 임계값에서 모든 빈도 높은 부분그래프를 탐지합니다. 이로 인해 이전의 MapReduce 기반 방법 대비 최대 6.5배 빠른 성능 향상을 달성합니다.
Frequent subgraph mining (FSM) is an important task for exploratory data analysis on graph data. Over the years, many algorithms have been proposed to solve this task. These algorithms assume that the data structure of the mining task is small enough to fit in the main memory of a computer. However, as the real-world graph data grows, both in size and quantity, such an assumption does not hold any longer. To overcome this, some graph database-centric methods have been proposed in recent years for solving FSM; however, a distributed solution using MapReduce paradigm has not been explored extensively. Since, MapReduce is becoming the de- facto paradigm for computation on massive data, an efficient FSM algorithm on this paradigm is of huge demand. In this work, we propose a frequent subgraph mining algorithm called MIRAGE which uses an iterative MapReduce based framework. MIRAGE is complete as it returns all the frequent subgraphs for a given user-defined support, and it is efficient as it applies all the optimizations that the latest FSM algorithms adopt. Our experiments with real life and large synthetic datasets validate the effectiveness of MIRAGE for mining frequent subgraphs from large graph datasets. The source code of MIRAGE is available from www.cs.iupui.edu/alhasan/software/
연구 동기 및 목표
- growing real-world 그래프 데이터세트에서 메모리 기반 빈도 높은 부분그래프 탐사(FSM) 알고리즘의 확장성 한계를 해결하기 위해.
- 대용량 데이터 처리에 널리 사용되는 MapReduce 패러다임을 활용해 완전하고 효율적인 FSM 솔루션을 설계하기 위해. 이는 MapReduce의 인기에도 불구하고 아직 성숙한 분산 솔루션이 부족하기 때문입니다.
- MapReduce와 같은 상태가 없는 분산 환경에서 상태 관리와 지원 집계의 과제를 극복하기 위해.
- MapReduce 반복 단계 간 중간 결과를 전파하여 모든 빈도 높은 부분그래프를 반복적으로 확장 가능하게 하기 위해.
- 다양한 설정에서 대규모 실제 및 합성 그래프 데이터세트에서 MiRage의 성능을 실험적으로 검증하기 위해.
제안 방법
- MiRage는 매 반복 단계에서 간선 수가 증가하는 부분그래프를 탐지하는 반복적 MapReduce 프레임워크를 사용합니다. 이는 크기 1 부분그래프에서 시작합니다.
- 각 맵 단계에서 맵퍼는 크기 i의 후보 부분그래프를 생성하고, 해당 파artition 내 입력 그래프에서의 로컬 지원을 계산합니다.
- 리듀서는 모든 맵퍼로부터 온 로컬 지원을 집계하여 전역 지원을 계산하고, 크기 i의 빈도 높은 부분그래프를 식별합니다.
- 알고리즘은 새로운 데이터 구조를 사용하여 모든 비영 지원 패턴을 유지하고 반복 단계 간 전파함으로써 탐사 상태를 유지합니다.
- 분할 전략이 최적화되어 있습니다: 스키마 2는 각 파artition의 총 간선 수를 균형 잡는 방식이며, 특히 불균형한 데이터세트에서 스키마 1(단지 그래프 수만 균형 잡기)보다 성능이 뛰어납니다.
- 시스템은 고유한 데이터 포맷과 I/O 최적화를 사용하여 네트워크 오버헤드를 줄이고 성능을 향상시킵니다.
실험 결과
연구 질문
- RQ1반복적 MapReduce 패러다임을 활용해 완전하고 효율적인 빈도 높은 부분그래프 탐사 알고리즘을 설계할 수 있는가?
- RQ2MapReduce의 상태가 없는 특성로 인해 전역 상태 없이도 지원 집계를 어떻게 달성할 수 있는가?
- RQ3MapReduce 환경에서 대규모 그래프 탐사에서 실행 시간을 최소화하는 데 가장 효과적인 분할 전략은 무엇인가?
- RQ4MiRage의 성능는 기존의 MapReduce 기반 FSM 방법과 비교해 확장성과 효율성 측면에서 어떻게 평가되는가?
- RQ5MiRage의 반복적 탐사 과정에서 런타임을 최소화하기 위해 최적의 입력 파artition 수는 얼마인가?
주요 결과
- MiRage는 Hill 등[32]의 MapReduce 기반 FSM 구현 대비 최대 6.5배 빠른 성능을 보였으며, 세 개의 생물학적 데이터세트에서 최소 지원 40% 조건에서 각각 16.6분, 8.3분, 17.5분의 실행 시간을 기록했습니다.
- MiRage의 최적 입력 파artition 수는 전통적인 MapReduce 작업보다 훨씬 높습니다. 예를 들어 효모 데이터세트의 경우 약 1000개의 파artition이 최적입니다. 이는 부분그래프 탐사의 지수적 복잡도 때문입니다.
- 불균형한 합성 데이터세트에서 스키마 2 분할 전략(각 파artition의 총 간선 수 균형 잡기)은 스키마 1(단지 그래프 수만 균형 잡기) 대비 최대 30%의 실행 시간 단축을 이룹니다.
- 맵퍼의 작업 부담 감소(지수적 이득)의 성능 향상 효과는 키-값 쌍 증가와 네트워크 I/O 증가(선형 비용)의 비용을 상회하여, 높은 파artition 수가 유리합니다.
- MiRage의 반복적 설계 덕분에 모든 비영 지원 패턴을 반복 단계 간 유지함으로써 완전성을 확보하여 모든 빈도 높은 부분그래프를 탐지할 수 있습니다.
- 50,000개의 그래프를 포함한 대규모 합성 데이터세트에서도 효과적으로 확장되며, 다양한 그래프 특성에 걸쳐 뛰어난 견고성을 보입니다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.