Skip to main content
QUICK REVIEW

[논문 리뷰] Interestingness Measure for Mining Spatial Gene Expression Data using Association Rule

M. Anandhavalli, M. K. Ghose|arXiv (Cornell University)|2010. 01. 20.
Data Mining Algorithms and Applications참고 문헌 17인용 수 8
한 줄 요약

이 논문은 공간적 유전자 발현 데이터 마이닝에서 연관 규칙를 필터링하고 순위를 매기기 위해 엔트로피와 분산을 흥미로움 측정 지표로 사용하는 것을 제안한다. 보수적 인덱스 기반의 단일 스캔 알고리즘과 부울 행렬 프루닝을 통합함으로써, 기존의 지지도-신뢰도 방법에 비해 더 다양한 생물학적으로 의미 있는 규칙를 효율적으로 식별할 수 있으며, 특히 엔트로피는 새로운 패턴을 포착하는 데 매우 효과적임을 입증한다.

ABSTRACT

The search for interesting association rules is an important topic in knowledge discovery in spatial gene expression databases. The set of admissible rules for the selected support and confidence thresholds can easily be extracted by algorithms based on support and confidence, such as Apriori. However, they may produce a large number of rules, many of them are uninteresting. The challenge in association rule mining (ARM) essentially becomes one of determining which rules are the most interesting. Association rule interestingness measures are used to help select and rank association rule patterns. Besides support and confidence, there are other interestingness measures, which include generality reliability, peculiarity, novelty, surprisingness, utility, and applicability. In this paper, the application of the interesting measures entropy and variance for association pattern discovery from spatial gene expression data has been studied. In this study the fast mining algorithm has been used which produce candidate itemsets and it spends less time for calculating k-supports of the itemsets with the Boolean matrix pruned, and it scans the database only once and needs less memory space. Experimental results show that using entropy as the measure of interest for the spatial gene expression data has more diverse and interesting rules.

연구 동기 및 목표

  • 표준 마이닝 알고리즘으로 생성된 대규모 데이터셋에서 진정으로 흥미로운 연관 규칙를 식별하는 데 도전하는 것.
  • 지지도-신뢰도 외에 엔트로피와 분산과 같은 추가적인 흥미로움 측정 지표를 통합하여 규칙 선택을 향상시키는 것.
  • 메모리 사용량을 줄이고 데이터베이스 스캔 횟수를 최소화하면서도 높은 규칙 품질을 유지하는 계산 효율성이 뛰어난 알고리즘을 개발하는 것.
  • 엔트로피와 분산이 공간적 유전자 발현 데이터에서 생물학적으로 관련된 패턴을 식별하는 데 얼마나 효과적인지 평가하는 것.

제안 방법

  • 데이터베이스를 단 한 번만 스캔하고, 계산 오버헤드를 줄이기 위해 부울 행렬 프루닝을 사용하는 빠른 마이닝 알고리즘을 채택하는 것.
  • 초기 후보 아이템세트와 연관 규칙를 생성하기 위해 지지도-신뢰도 임계값을 적용하는 것.
  • 지지도-신뢰도 외에 엔트로피와 분산을 추가적인 흥미로움 측정 지표로 도입하여 규칙를 순위 매기고 필터링하는 것.
  • 엔트로피를 사용해 규칙 분포의 다양성과 정보량을 정량화하고, 균일하지 않으며 정보가 풍부한 패턴을 선호하는 것.
  • 분산을 사용해 이상적이거나 이질적인 발현 패턴을 탐지하여 생물학적으로 의미 있는 연관성을 가리키는 것.
  • 이러한 측정 지표를 조합하여 빈도가 높고 신뢰도가 높을 뿐 아니라 공간 분포에서 놀랍거나 새로운 패턴을 보이는 규칙를 우선순위에 올리는 것.

실험 결과

연구 질문

  • RQ1지지도-신뢰도 외에 어떤 흥미로움 측정 지표가 공간적 유전자 발현 데이터에서 생물학적으로 의미 있는 패턴을 가장 효과적으로 식별하는가?
  • RQ2흥미로움 측정 지표로 엔트로피를 사용할 경우, 마이닝된 연관 규칙의 다양성과 관련성은 어떻게 향상되는가?
  • RQ3분산 기반 필터링은 생물학적으로 의미 있는 희귀하거나 이질적인 유전자 발현 패턴을 탐지할 수 있는가?
  • RQ4제안된 알고리즘이 공간적 유전자 발현 마이닝에서 규칙 품질을 유지하면서 계산 비용을 얼마나 줄이는가?

주요 결과

  • 엔트로피 기반의 흥미로움 측정 지표는 다른 측정 지표에 비해 더 다양한 생물학적으로 흥미로운 연관 규칙를 생성하였다.
  • 제안된 알고리즘은 데이터베이스를 단 한 번만 스캔하고 부울 행렬 프루닝을 적용함으로써 더 빠른 규칙 생성과 함께 메모리 사용량을 감소시켰다.
  • 엔트로피로 순위 매겨진 규칙는 높은 신규성과 낮은 중복성을 보였으며, 새로운 공간적 유전자 발현 패턴을 발견할 잠재력이 뛰어나다는 것을 시사한다.
  • 분산은 희귀하거나 이질적인 발현 패턴을 식별하는 데 기여하여, 잠재적으로 중요한 생물학적 상호작용을 탐지하는 데 도움이 되었다.
  • 실험 결과, 엔트로피는 유전자 발현 데이터에서 의미 있는 비균일한 공간적 연관성을 포착하는 데 다른 측정 지표보다 뛰어난 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.