Skip to main content
QUICK REVIEW

[논문 리뷰] Towards a semantic and statistical selection of association rules

Slim Bouker, Rabie Saidi|arXiv (Cornell University)|2013. 05. 24.
Data Mining Algorithms and Applications참고 문헌 32인용 수 4
한 줄 요약

이 논문은 규칙 폭발 문제를 줄이기 위해 스카이라인 지배와 의미적 비교 가능성을 활용한 새로운 알고리즘 RAR를 제안한다. 이 알고리즘은 임계값 설정이나 측정 기준 선택이 필요 없이 규칙 집합의 압축을 약 90%까지 달성하며, 기존의 임계값 기반 방법보다 규칙 집합의 크기와 일관성에서 뛰어난 성능을 보인다.

ABSTRACT

The increasing growth of databases raises an urgent need for more accurate methods to better understand the stored data. In this scope, association rules were extensively used for the analysis and the comprehension of huge amounts of data. However, the number of generated rules is too large to be efficiently analyzed and explored in any further process. Association rules selection is a classical topic to address this issue, yet, new innovated approaches are required in order to provide help to decision makers. Hence, many interesting- ness measures have been defined to statistically evaluate and filter the association rules. However, these measures present two major problems. On the one hand, they do not allow eliminating irrelevant rules, on the other hand, their abun- dance leads to the heterogeneity of the evaluation results which leads to confusion in decision making. In this paper, we propose a two-winged approach to select statistically in- teresting and semantically incomparable rules. Our statis- tical selection helps discovering interesting association rules without favoring or excluding any measure. The semantic comparability helps to decide if the considered association rules are semantically related i.e comparable. The outcomes of our experiments on real datasets show promising results in terms of reduction in the number of rules.

연구 동기 및 목표

  • 연관 규칙 추출 알고리즘이 생성하는 과도한 규칙 집합 문제를 해결한다.
  • 기존의 이국적 측정 기준들이 의미적으로 무관한 규칙를 제거하지 못하는 한계를 극복한다.
  • 어느 한 측정 기준에도 편향되지 않으면서도 의미적 일관성을 확보하는 통합된 규칙 선택 프레임워크를 제공한다.
  • 사용자 지정 임계값 설정 없이도 의사결정에 적합한 관리 가능한 대표 규칙 집합으로 규칙 수를 줄인다.
  • 실세계 응용에서 개인화된 랭킹 및 사용자 중심의 의사결정 지원을 가능하게 하는 효과적인 규칙 선택을 실현한다.

제안 방법

  • 다양한 이국적 측정 기준에 기반해 스카이라인 연산자를 적용하여 지배되지 않는 규칙를 식별한다. 여기서 어떤 규칙이 다른 규칙보다 모든 측정 기준에서 우월하면 지배된다고 간주한다.
  • 지배 적용 이전에 두 규칙이 동일한 의미적 맥락에 속하는지 판단하기 위해 의미적 비교 가능성 모델을 도입한다.
  • 의미적으로 비교 가능한 규칙들 간에만 지배 관계를 비교하는 지배 기반 필터링 프로세스를 사용하여 잘못된 제거를 방지한다.
  • 지배되지 않으며 상호 비교 가능한 부분집합에서 최소한의 중복이 없는 규칙 집합을 선택하는 대표 규칙 생성 메커니즘을 통합한다.
  • 신뢰도, 재현율, Pearl, Loevinger, Zhang 등의 다양한 통계 측정 기준을 사용한 다중 측정 평가 프레임워크를 활용한다.
  • 실세계 데이터셋(UCI 저장소 소속)을 사용해 규칙 수 감소 및 의미적 일관성 평가를 통해 규칙 집합을 평가한다.

실험 결과

연구 질문

  • RQ1임계값 설정에 의존하지 않고 규칙 수를 줄일 수 있는 연관 규칙 선택 방법은 무엇인가?
  • RQ2기존의 이국적 측정 기준은 규칙 순위 매기기에 얼마나 불일치하거나 모순적인 영향을 미치는가?
  • RQ3다양한 측정 기준을 활용한 지배 기반 접근이 특정 측정 기준에 편향되지 않고 가장 중요한 규칙들을 효과적으로 식별할 수 있는가?
  • RQ4의미적 비교 가능성은 규칙 선택 과정에서 의미적으로 관련 없는 규칙가 잘못 제거되는 것을 방지하는 데 어떻게 기여하는가?
  • RQ5이국적 측정 기준의 수와 종류가 최종 규칙 집합의 크기와 품질에 미치는 영향은 어떠한가?

주요 결과

  • RAR 알고리즘은 임계값 기반 규칙 집합 대비 대표 규칙 수를 최대 90%까지 감소시켜 뛰어난 압축 성능를 입증한다.
  • 지배 조건이 다수의 측정 기준에 걸쳐 엄격하게 적용되므로 지배되지 않는 규칙 수는 종종 매우 낮다—가끔 10개 미만일 수도 있다.
  • 평가 프레임워크에 더 많은 측정 기준을 추가하면 지배 관계의 변화에 따라 대표 규칙 수가 증가하거나 감소할 수 있다.
  • 최적의 임계값 설정을 해도 대표 규칙 집합은 항상 임계값 기반 규칙 집합(TB-rules)보다 작으며, 이는 RAR의 뛰어난 감소 능력을 입증한다.
  • 의미적 비교 가능성은 맥락적으로 관련 없는 규칙가 제거되는 것을 방지하여 유의미한 다양성을 유지하고 잘못된 배제를 피한다.
  • 통계적 엄밀함과 의미적 관련성 사이의 균형을 이루어 의사결정자들이 실질적으로 활용할 수 있는 더 일관되고 효과적인 규칙 집합을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.