Skip to main content
QUICK REVIEW

[논문 리뷰] Categorization of interestingness measures for knowledge extraction

Sylvie Guillaume, Dhouha Grissa|arXiv (Cornell University)|2012. 06. 28.
Data Mining Algorithms and Applications참고 문헌 50인용 수 7
한 줄 요약

이 논문은 21개의 사전 정의된 이론적 성질에 대한 이행성을 바탕으로, 워드 계층적 군집화와 k-means를 사용하여 61개의 연관 규칙 흥미로움 측정법을 공식적으로 분류한다. 연구는 측정법의 행동 특성에 유사성이 있는 7개의 서로 다른 클래스를 규명하여 지식 추출에서 적절한 측정법을 선택하는 데 원칙적인 프레임워크를 제공함으로써 사용자 선택의 복잡성을 줄이고 규칙의 관련성 필터링을 향상시킨다.

ABSTRACT

Finding interesting association rules is an important and active research field in data mining. The algorithms of the Apriori family are based on two rule extraction measures, support and confidence. Although these two measures have the virtue of being algorithmically fast, they generate a prohibitive number of rules most of which are redundant and irrelevant. It is therefore necessary to use further measures which filter uninteresting rules. Many synthesis studies were then realized on the interestingness measures according to several points of view. Different reported studies have been carried out to identify "good" properties of rule extraction measures and these properties have been assessed on 61 measures. The purpose of this paper is twofold. First to extend the number of the measures and properties to be studied, in addition to the formalization of the properties proposed in the literature. Second, in the light of this formal study, to categorize the studied measures. This paper leads then to identify categories of measures in order to help the users to efficiently select an appropriate measure by choosing one or more measure(s) during the knowledge extraction process. The properties evaluation on the 61 measures has enabled us to identify 7 classes of measures, classes that we obtained using two different clustering techniques.

연구 동기 및 목표

  • 연관 규칙 탐색에서 '좋은' 흥미로움 측정법을 특성화하는 성질의 집합을 확장하고 공식적으로 정의하는 것.
  • 이러한 공식화된 성질들에 대해 기존의 61개의 흥미로움 측정법의 행동을 분석하는 것.
  • 군집화 기법을 사용하여 유사한 성질 프로파일을 가진 측정법의 자연스러운 군집(클래스)을 식별하는 것.
  • 검출된 측정법 클래스에 대한 의미적 해석을 제공하여 사용자가 관련 측정법을 선택하는 데 도움을 주는 것.
  • 기존 연구와의 비교를 통해 분류를 검증하고 실무에서 사용 가능한 공감대 기반의 분류 체계를 제안하는 것.

제안 방법

  • 흥미로움 측정법에 대해 바람직한 것으로 간주되는 21개의 이론적 성질(대칭성, 단조성, 특정 변환에 대한 불변성 등)을 공식화한다.
  • 61개의 측정법 × 21개의 성질로 구성된 행렬을 구축하며, 각 항목은 특정 측정법이 주어진 성질를 만족하는지 여부를 나타낸다.
  • 성질 유사성에 기반하여 측정법의 포함된 군집을 탐지하기 위해 워드의 집합적 계층 군집화 기법을 적용한다.
  • 비계층적 대안으로 수정된 k-means 군집화 알고리즘을 사용하여 계층적 결과를 검증한다.
  • 두 군집화 기법 간의 일치를 바탕으로 공감대 기반의 분류를 도출하여 결과의 강건성을 확보한다.
  • 최종 분류는 측정법 클래스가 기반하는 통계적 또는 논리적 행동과 연결되도록 의미적으로 해석된다.

실험 결과

연구 질문

  • RQ161개의 흥미로움 측정법 중에서 21개의 공식화된 성질 전반에 걸쳐 일관된 행동을 보이는 측정법는 무엇인가?
  • RQ2군집화 기법을 통해 공통된 성질 프로파일을 가진 측정법의 자연스러운 군집이 드러나는가?
  • RQ3검출된 측정법 클래스는 규칙 탐색에서 의미 있는 의미적 범주와 일치하는가?
  • RQ4워드와 k-means 간의 군집 결과는 어떻게 비교되며, 공감대가 존재하는가?
  • RQ5식별된 클래스는 기존 문헌과의 비교를 통해 검증 가능하며 실무에서 측정법 선택을 안내하는 데 사용될 수 있는가?

주요 결과

  • 공감대 군집화를 통해 측정법의 행동 특성이 유사한 7개의 서로 다른 클래스를 규명하였다.
  • 워드의 방법과 k-means의 군집 결과 간에 강한 일치를 보이며, 검출된 클래스의 강건성을 검증하였다.
  • Lift, Kulczynski, Jaccard 등의 측정법은 대칭적이고 신뢰도 기반의 규칙 강도 평가를 특징으로 하는 클래스에 속해 있다.
  • Piatetsky-Shapiro와 Leverage 등의 측정법을 포함하는 별도의 클래스는 독립성에서의 이탈을 강조하며 희귀 사건에 민감하다.
  • 상호정보량과 J-Measure를 포함하는 클래스는 정보이론적 기반을 지니며 공동 분포 패턴에 민감하다는 점에서 두드러진다.
  • 이 분류는 사용자가 원하는 규칙 필터링 기준(예: 신선도, 강도, 신뢰성 등)과 일치하는 측정법 선택을 돕는 의미적 프레임워크를 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.