[논문 리뷰] Evaluation of Frequent Itemset Mining Platforms using Apriori and FP-Growth Algorithm
이 논문은 Apriori 및 FP-Growth 알고리즘을 사용하여 다양한 데이터 규모에서 빈번한 항목집합 탐색을 수행하는 데 MapReduce 기반 플랫폼인 Hadoop, Spark, Flink를 평가한다. 결과적으로 Spark는 메모리 기반 처리 및 최적화된 반복 계산 모델 덕분에 실행 시간과 확장성 면에서 Hadoop 및 Flink를 뛰어넘으며, 특히 대규모 데이터셋에서 뛰어난 성능을 보인다.
With the overwhelming amount of complex and heterogeneous data pouring from any-where, any-time, and any-device, there is undeniably an era of Big Data. The emergence of the Big Data as a disruptive technology for next generation of intelligent systems, has brought many issues of how to extract and make use of the knowledge obtained from the data within short times, limited budget and under high rates of data generation. Companies are recognizing that big data can be used to make more accurate predictions, and can be used to enhance the business with the help of appropriate association rule mining algorithm. To help these organizations, with which software and algorithm is more appropriate for them depending on their dataset, we compared the most famous three MapReduce based software Hadoop, Spark, Flink on two widely used algorithms Apriori and Fp-Growth on different scales of dataset.
연구 동기 및 목표
- 주요 빅데이터 플랫폼인 Hadoop, Spark, Flink가 빈번한 항목집합 탐색 워크로드를 수행할 때의 성능을 평가하는 것.
- 분산 컴퓨팅 프레임워크를 사용하여 다양한 데이터 크기에서 Apriori 및 FP-Growth 알고리즘의 확장성과 효율성을 평가하는 것.
- 데이터셋 크기, 예산, 성능 제약 조건에 기반하여 조직에 가장 적합한 플랫폼-알고리즘 조합을 식별하는 것.
- 다양한 데이터 스케일과 플랫폼 간 실행 시간, 메모리 사용량, 처리 속도에 대한 실증적 증거를 제공하는 것.
제안 방법
- 일관된 데이터셋 크기로 Hadoop, Spark, Flink에 Apriori 및 FP-Growth 알고리즘을 구현하였다.
- 실험을 위해 소규모, 중규모, 대규모 데이터 스케일을 설정하여 증가하는 데이터 볼륨 하에서의 성능을 평가하였다.
- 모든 플랫폼과 알고리즘 간의 주요 성능 지표로 실행 시간, 메모리 소비량, 처리량을 측정하였다.
- 공정한 플랫폼 간 비교를 보장하기 위해 동일한 하드웨어 환경을 사용하였다.
- 각 플랫폼의 네이티브 실행 모델을 활용하여 클러스터에 걸쳐 계산을 분산하는 데 MapReduce 기반 병렬 처리를 적용하였다.
- 재현 가능성을 보장하고 성능 비교에 대한 편향을 제거하기 위해 입력 데이터 형식과 전처리 단계를 표준화하였다.
실험 결과
연구 질문
- RQ1Apriori 및 FP-Growth 알고리즘을 사용할 때 Hadoop, Spark, Flink의 실행 시간은 어떻게 비교되는가?
- RQ2동일한 알고리즘을 사용할 때 점점 더 큰 데이터셋을 처리할 경우 어떤 플랫폼이 더 나은 확장성을 보이는가?
- RQ3알고리즘 선택(즉, Apriori 대비 FP-Growth)이 다양한 빅데이터 플랫폼에서 성능에 어떤 영향을 미치는가?
- RQ4데이터 크기가 분산된 빈번한 항목집합 탐색에서 메모리 사용량과 처리 효율성에 어떤 영향을 미치는가?
- RQ5실제 비즈니스 응용 프로그램에서 가장 뛰어난 성능 대비 비용 비율을 제공하는 플랫폼 및 알고리즘 조합은 무엇인가?
주요 결과
- Spark는 모든 데이터 스케일에서 가장 낮은 실행 시간을 기록했으며, 메모리 기반 계산 모델 덕분에 Hadoop 및 Flink를 뛰어넘었다.
- 모든 플랫폼에서 FP-Growth가 Apriori보다 빠르게 실행되었으며, 특히 대규모 데이터셋에서 압축된 데이터베이스 구조 덕분에 빠른 성능을 보였다.
- Hadoop는 디스크 I/O 병목 현상으로 인해 가장 높은 실행 시간을 기록했으며, 대규모 데이터셋에서는 가장 낮은 확장성을 보였다.
- Flink는 중간 수준의 성능을 보였으며, Hadoop보다는 나은 편이지만 Spark보다는 열 劣한 성능을 보였다. 특히 반복 처리 워크로드에서 두드러졌다.
- 데이터 크기가 증가함에 따라 플랫폼 간 성능 격차가 커졌으며, Spark는 대규모 환경에서 뛰어난 효율성을 유지했다.
- 특히 Apriori와 같은 반복 알고리즘에서는 Spark의 메모리 사용량이 Hadoop보다 크게 낮았다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.