Skip to main content
QUICK REVIEW

[논문 리뷰] Granular association rules on two universes with four measures

Fan Min|arXiv (Cornell University)|2012. 09. 25.
Rough Sets and Fuzzy Logic참고 문헌 43인용 수 9
한 줄 요약

이 논문은 두 개의 유니버스 간에 균질적인 연관 규칙을 도입하며, 전통적인 지지도 및 신뢰도 외에 소스 커버리지, 타겟 커버리지, 소스 신뢰도, 타겟 신뢰도의 네 가지 의미 체계를 사용하여, 기존의 지지도 및 신뢰도에 의존하는 것보다 더 풍부하고 세밀한 패턴 탐색을 가능하게 한다. 이 방법은 고도로 최적화된 하위유형별 알고리즘을 통해 2–3개의 지수 차수 빠른 속도 향상을 이끌어내며, 특히 하나의 하위유형에 대해 정방향/역방향 알고리즘을 사용한 추가 최적화도 가능하다.

ABSTRACT

Relational association rules reveal patterns hide in multiple tables. Existing rules are usually evaluated through two measures, namely support and confidence. However, these two measures may not be enough to describe the strength of a rule. In this paper, we introduce granular association rules with four measures to reveal connections between granules in two universes, and propose three algorithms for rule mining. An example of such a rule might be "40% men like at least 30% kinds of alcohol; 45% customers are men and 6% products are alcohol." Here 45%, 6%, 40%, and 30% are the source coverage, the target coverage, the source confidence, and the target confidence, respectively. With these measures, our rules are semantically richer than existing ones. Three subtypes of rules are obtained through considering special requirements on the source/target confidence. Then we define a rule mining problem, and design a sandwich algorithm with different rule checking approaches for different subtypes. Experiments on a real world dataset show that the approaches dedicated to three subtypes are 2-3 orders of magnitudes faster than the one for the general case. A forward algorithm and a backward algorithm for one particular subtype can speed up the mining process further. This work opens a new research trend concerning relational association rule mining, granular computing and rough sets.

연구 동기 및 목표

  • 다중 관계 데이터베이스에서 지지도와 신뢰도에만 의존하는 전통적 연관 규칙의 의미적 한계를 해결한다.
  • 고객과 제품 등의 두 데이터 유니버스 간의 다대다 관계에서 더 표현력 있는 패턴 탐색을 가능하게 한다.
  • 소스/타겟 신뢰도 임계값에 의해 정의된 규칙의 하위유형에 특화된 효율적인 추출 알고리즘을 개발한다. 특히 신뢰도가 100%에 도달할 경우에 초점을 맞춘다.
  • 균질 컴퓨팅, 관계 기반 연관 규칙 추출, 추천 시스템을 융합하여, 새로운 사용자와 새로운 항목이 포함된 냉시작 시나리오에 특히 유용한 접근을 제공한다.
  • 실제 데이터셋에서 복잡한 관계를 가진 복잡한 관계를 다룰 수 있는 확장 가능한 의미 기반 규칙 추출 기반을 마련한다.

제안 방법

  • 네 가지 측정치 정의: 소스 커버리지(소스 균질의 비율), 타겟 커버리지(타겟 균질의 비율), 소스 신뢰도(소스 균질 인스턴스 중 타겟과 일치하는 비율), 타겟 신뢰도(타겟 균질 인스턴스 중 소스와 일치하는 비율).
  • 두 유니버스 간의 균질을 연결하는 문장으로 균질 연관 규칙를 정식화하며, 이는 이중 신뢰도 및 커버리지 측정치 덕분에 기존 연관 규칙보다 더 풍부한 의미를 지닌다.
  • 소스 신뢰도, 타겟 신뢰도, 또는 둘 다 100%인지를 기준으로 하위유형 3종을 도입하여 전문화된 최적화를 가능하게 한다.
  • 각 하위유형에 맞는 다른 규칙 검사 전략을 적용하는 '샌드위치 알고리즘'을 제안하며, 일반적인 경우의 완전 탐색보다 효율성이 뛰어나다.
  • 완전 일치 하위유형(100% 소스 및 타겟 신뢰도)에 대해 정방향 및 역방향 알고리즘을 설계하여, 근사치 기반의 rough set을 활용해 계산 속도를 향상시킨다.
  • Apriori 성질과 균질 기반의 가지치기를 활용하여 검색 공간을 줄이며, 특히 대규모 데이터셋에서 효과적이다.

실험 결과

연구 질문

  • RQ1두 유니버스 간의 연관 규칙는 전통적인 지지도 및 신뢰도 외에 어떤 방식으로 풍부화될 수 있으며, 이를 통해 실제 세계의 관계를 더 잘 반영할 수 있는가?
  • RQ2균질 연관 규칙 추출에서 일반 규칙 추출과 하위유형별 최적화 간의 성능 상충 관계는 어떠한가?
  • RQ3정방향 및 역방향 알고리즘은 완전 일치 규칙 하위유형의 추출을 어떻게 빠르게 만들 수 있는가?
  • RQ4소스 및 타겟 양측의 커버리지 및 신뢰도를 포함한 네 가지 제안된 측정치는 발견된 규칙의 해석 가능성과 의미의 풍부함을 어떻게 향상시키는가?
  • RQ5제안된 알고리즘은 다양한 크기의 실세계 데이터셋과 다양한 임계값에서 어떻게 확장 가능한가?

주요 결과

  • 제안된 네 측정치 프레임워크는 기존 연관 규칙보다 의미적으로 더 풍부한 규칙을 제공하며, 소스 및 타겟 균질 커버리지와 신뢰도를 모두 반영한다.
  • 세 가지 하위유형별 전용 알고리즘은 두 개의 실세계 데이터셋에서 일반 사례 알고리즘 대비 2–3개 지수 차수 빠른 성능을 달성한다.
  • 정방향 및 역방향 알고리즘은 완전 일치 하위유형의 추출을 추가로 가속화하여 기존 기반 접근 대비 뚜렷한 속도 향상을 보여준다.
  • 샌드위치 알고리즘은 각 하위유형에 맞는 규칙 검사 전략을 적용하여 효율성을 효과적으로 균형 잡는다.
  • 이 방법은 새로운 사용자와 새로운 항목 간의 관계를 균질적 연관을 통해 모델링함으로써 효과적인 냉시작 추천을 가능하게 한다.
  • 커버링 기반 rough set 및 변수 정밀도 rough set 기반 이론적 기초는 향후 더 복잡한 규칙 유형으로의 확장에 유망한 기반을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.