[논문 리뷰] Mining The Data From Distributed Database Using An Improved Mining Algorithm
이 논문은 지리적으로 분산된 데이터베이스에서 통신 비용을 줄이고 효율성을 향상시키기 위해 LMatrix 기법을 사용한 개선된 분산 연관 규칙 마이닝 알고리즘을 제안한다. LMatrix를 통해 로컬 지원도를 계산하고 데이터베이스 스캔 횟수를 최소화함으로써, 분산 환경에서 순차적 방법보다 빠른 실행 속도와 더 나은 확장성을 달성한다.
Association rule mining is an active data mining research area and most ARM algorithms cater to a centralized environment. Centralized data mining to discover useful patterns in distributed databases isn't always feasible because merging data sets from different sites incurs huge network communication costs. In this paper, an Improved algorithm based on good performance level for data mining is being proposed. In local sites, it runs the application based on the improved LMatrix algorithm, which is used to calculate local support counts. Local Site also finds a centre site to manage every message exchanged to obtain all globally frequent item sets. It also reduces the time of scan of partition database by using LMatrix which increases the performance of the algorithm. Therefore, the research is to develop a distributed algorithm for geographically distributed data sets that reduces communication costs, superior running efficiency, and stronger scalability than direct application of a sequential algorithm in distributed databases.
연구 동기 및 목표
- 중앙 집중식 연관 규칙 마이닝에서 분산된 사이트로부터 데이터를 병합할 때 발생하는 높은 통신 오버헤드를 해결한다.
- 네트워크 비용과 확장성 문제로 인해 기존 순차적 알고리즘이 분산 데이터베이스에서 성능에 한계를 가진다는 점을 극복한다.
- 데이터베이스 스캔 횟수와 통신 라운드 수를 줄이는 확장성 있고 효율적인 분산 마이닝 알고리즘을 개발한다.
- 각 사이트에서 LMatrix 기법을 활용해 로컬 지원도 계산을 통해 성능을 향상시킨다.
- 최적화된 메시지 전달 방식을 사용하는 중심 조정 사이트를 통해 글로벌 빈번한 항목집합을 탐지할 수 있도록 한다.
제안 방법
- 각 로컬 사이트에 개선된 LMatrix 알고리즘을 적용하여 로컬 지원도 계산을 효율적으로 수행한다.
- 지정된 중심 사이트를 통해 메시지 교환을 조율하고 로컬 결과를 집계하여 글로벌 빈번한 항목집합을 계산한다.
- 로컬 데이터 처리에 최적화된 LMatrix 구조를 통해 데이터베이스 스캔 횟수를 최소화한다.
- 예를 들어 로컬 빈번한 항목집합과 같은 필수 정보만 전송하여 통신 비용을 줄인다.
- 로컬 사이트와 중심 사이트 간의 메시지 전달 메커니즘을 통합하여 결과를 동기화하고 글로벌 패턴을 구축한다.
- 증가하는 데이터 볼륨과 분산된 사이트 수에 비례하여 잘 확장될 수 있도록 알고리즘을 설계한다.
실험 결과
연구 질문
- RQ1지리적으로 산재한 데이터베이스에서 분산 연관 규칙 마이닝의 통신 비용을 어떻게 최소화할 수 있는가?
- RQ2기존 방법과 비교해 LMatrix 기반 로컬 지원도 계산이 성능에 얼마나 기여하는가?
- RQ3분산 환경에서 순차적 알고리즘보다 더 나은 확장성과 효율성을 달성할 수 있는가?
- RQ4데이터베이스 스캔 횟수를 줄이면 분산 마이닝의 전체 실행 시간에 어떤 영향을 미치는가?
- RQ5중심 사이트를 통한 조정 메커니즘이 데이터 전송을 최소화하면서 정확성을 유지하는 데 얼마나 효과적인가?
주요 결과
- 제안된 알고리즘은 로컬 지원도 계산을 위해 LMatrix 구조를 활용함으로써 데이터베이스 스캔 횟수를 크게 줄였다.
- 선택적 메시지 전달을 통해 통신 비용을 최소화하였으며, 중심 사이트로 전송되는 것은 필수적인 로컬 빈번한 항목집합뿐이었다.
- 분산 환경에서 순차적 마이닝 알고리즘을 직접 적용한 경우보다 알고리즘이 훨씬 뛰어난 실행 효율성을 보였다.
- 전체 데이터 전송 의존도가 감소하고 로컬 및 중심 사이트 간의 최적화된 조율 덕분에 확장성이 향상되었다.
- LMatrix의 사용으로 로컬 처리 속도가 향상되어 글로벌 빈번한 항목집합 탐지의 수렴 속도가 빨라졌다.
- 분산된 데이터 소스를 효율적으로 운영하면서도 패턴 탐지 정확도를 높게 유지했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.