Skip to main content
QUICK REVIEW

[논문 리뷰] A Bayesian Approach to Rule Mining

Luis I. Lopera González, Adrian Derungs|arXiv (Cornell University)|2019. 12. 13.
Data Mining Algorithms and Applications참고 문헌 23인용 수 4
한 줄 요약

이 논문은 룰 신뢰도를 순환적으로 베이즈 업데이트를 통해 계산하는 새로운 접근법인 베이지안 룰 마이닝(BRM)을 제안한다. 이는 새로운 관측값이 추가될수록 신뢰도가 증가함을 보장하며, 지원도 감소 문제를 피하고 희귀하지만 의미 있는 룰을 효과적으로 추출한다. 기존의 빈도 기반 룰 마이닝(FRM)과 달리, BRM은 데이터셋 간 공통성을 중심으로 하는 것이 아니라 개별 프로세스의 동적 특성에 초점을 맞춘다.

ABSTRACT

In this paper, we introduce the increasing belief criterion in association rule mining. The criterion uses a recursive application of Bayes' theorem to compute a rule's belief. Extracted rules are required to have their belief increase with their last observation. We extend the taxonomy of association rule mining algorithms with a new branch for Bayesian rule mining~(BRM), which uses increasing belief as the rule selection criterion. In contrast, the well-established frequent association rule mining~(FRM) branch relies on the minimum-support concept to extract rules. We derive properties of the increasing belief criterion, such as the increasing belief boundary, no-prior-worries, and conjunctive premises. Subsequently, we implement a BRM algorithm using the increasing belief criterion, and illustrate its functionality in three experiments: (1)~a proof-of-concept to illustrate BRM properties, (2)~an analysis relating socioeconomic information and chemical exposure data, and (3)~mining behaviour routines in patients undergoing neurological rehabilitation. We illustrate how BRM is capable of extracting rare rules and does not suffer from support dilution. Furthermore, we show that BRM focuses on the individual event generating processes, while FRM focuses on their commonalities. We consider BRM's increasing belief as an alternative criterion to thresholds on rule support, as often applied in FRM, to determine rule usefulness.

연구 동기 및 목표

  • 데이터셋 크기가 증가함에 따라 룰 지원도가 감소하는 빈도 기반 룰 마이닝(FRM)에서 발생하는 지원도 감소 문제를 해결하기 위해.
  • 최소 지원도 기준으로 인해 희귀하지만 일관된 룰을 추출하기 어려운 FRM의 한계를 극복하기 위해.
  • 신뢰도를 룰 선택 기준으로 삼는 새로운 룰 마이닝 분류 체계인 베이지안 룰 마이닝(BRM)을 제안하기 위해.
  • 특히 이질적인 데이터셋에서 개별 프로세스의 동적 특성을 드러내는 룰을 추출할 수 있음을 입증하기 위해.
  • 실제 응용 분야인 사회경제적 데이터 및 신경학적 재활과 같은 분야에서 BRM의 실현 가능성을 보여주기 위해.

제안 방법

  • 규칙의 신뢰도를 점차 증가시키는 기준을 제안하며, 각 새로운 관측값이 있을 때마다 베이즈 정리의 순환적 적용을 통해 규칙의 신뢰도를 갱신한다.
  • 핵심 성질인 증가하는 신뢰도 경계, 사전 우려 없음, 그리고 결합 전제를 도출하여 룰의 안정성과 해석 가능성 보장.
  • 사전 확률, 관측된 데이터, 우도를 기반으로 한 신뢰도 갱신을 사용하는 체계적 탐색 BRM 알고리즘을 구현한다.
  • 마이닝 이후 필터링 단계를 도입하여 관련 없는 룰을 제거하며, 이 필터 선택은 응용 맥락에 따라 달라진다 (예: 신뢰도 기준 또는 결론별 최고의 신뢰도).
  • 신뢰도 갱신 공식을 적용한다: 신뢰도 = p * P(데이터|규칙) / P(데이터), 새로운 데이터가 도착할 때마다 순환적으로 갱신.
  • 합성 시간 시리즈, 사회경제적-화학적 노출 데이터, 재활 중 환자 행동 룰 등 세 가지 데이터셋을 사용해 BRM을 검증한다.

실험 결과

연구 질문

  • RQ1신뢰도 기반 기준이 최소 지원도 기준을 대체하여 지원도 감소 문제를 방지할 수 있는가?
  • RQ2FRM이 낮은 지원도로 인해 놓치는 희귀하지만 일관된 룰을 BRM이 효과적으로 추출할 수 있는가?
  • RQ3FRM이 공통성을 강조하는 데 반해, BRM은 개별 프로세스의 동적 특성을 더 잘 드러내는가?
  • RQ4이질적인 프로세스와 희귀 사건을 포함한 실생활 데이터셋에서 BRM의 성능은 어떠한가?
  • RQ5루밍 분석을 통해 활동적 vs. 정적 행동 하위군으로 환자를 분류하는 데 BRM을 사용할 수 있는가?

주요 결과

  • BRM은 데이터셋 크기가 증가함에 따라 지원도 감소 문제를 겪지 않으며, 희귀 룰을 성공적으로 추출한다.
  • 사회경제적 데이터 실험에서 BRM은 저빈도 빈도의 룰을 발견했으며, 예를 들어 빈곤 점수 낮은 경우 교육 수준 높은 경향이 있다는 의미 있는 연관성을 규명했다.
  • 재활 연구에서 BRM은 FRM이 그러한 그룹화를 탐지하지 못한 바탕으로 환자를 활동적 및 정적 행동 하위군으로 분류했다.
  • PEP 분석 결과, FRM의 룰은 환자 서브셋 간에 변화가 없었으며, 이는 인구 전체의 공통성을 반영함을 시사했고, 반면 BRM의 룰은 변화를 보이며 프로세스 특화 패턴을 드러냈다.
  • BRM의 신뢰도 지표는 데이터셋 크기 변화에 강건하며, 예상 빈도 비율과 전이 시간과 같은 프로세스 지식을 활용해 조정 가능하다.
  • 필터링 전략은 응용에 맞게 맞춤화되어야 하며, 프로세스 간 분리에는 신뢰도 기준이 잘 작동하고, 전이 마이닝에는 결론별 최고의 신뢰도 필터가 적합하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.