Skip to main content
QUICK REVIEW

[논문 리뷰] Efficient mining of maximal biclusters in mixed-attribute datasets

Rosana Veroneze, Fernando J. Von Zuben|arXiv (Cornell University)|2017. 10. 09.
Data Mining Algorithms and Applications참고 문헌 21인용 수 4
한 줄 요약

이 논문은 이산화 또는 사전 처리 없이 혼합 속성 데이터셋에서 최대 이분군을 직접 채굴할 수 있는 효율적이고 열거형 이분군화 알고리즘인 RIn-Close_CVC-Mix를 제안한다. 이 알고리즘은 다항시간 효율성, 완전성, 정확성, 중복 제거를 유지하며, 빈 패턴 채굴을 활용하여 해석 가능한 정량적 클래스 연관 규칙(QCARs)을 생성하여 레이블이 부여된 데이터셋에 대해 간결하고 고품질의 모델을 제공한다.

ABSTRACT

This paper presents a novel enumerative biclustering algorithm to directly mine all maximal biclusters in mixed-attribute datasets (containing both numerical and categorical attributes), with or without missing values. The proposal is an extension of RIn-Close_CVC, which was originally conceived to mine perfect or perturbed biclusters with constant values on columns solely from numerical datasets, and without missing values. Even endowed with additional and more general features, the extended RIn-Close_CVC retains four key properties: (1) efficiency, (2) completeness, (3) correctness, and (4) non-redundancy. Our proposal is the first one to deal with mixed-attribute datasets without requiring any pre-processing step, such as discretization and itemization of real-valued attributes. This is a decisive aspect, because discretization and itemization implies a priori decisions, with information loss and no clear control over the consequences. On the other hand, even having to specify a priori an individual threshold for each numerical attribute, that will be used to indicate internal consistency per attribute, each threshold will be applied during the construction of the biclusters, shaping the peculiarities of the data distribution. We also explore the strong connection between biclustering and frequent pattern mining to (1) provide filters to select a compact bicluster set that exhibits high relevance and low redundancy, and (2) in the case of labeled datasets, automatically present the biclusters in a user-friendly and intuitive form, by means of quantitative class association rules. Our experimental results showed that the biclusters yield a parsimonious set of relevant rules, providing useful and interpretable models for five mixed-attribute labeled datasets.

연구 동기 및 목표

  • 수치형 및 기호형 속성을 모두 포함하는 혼합 속성 데이터셋에 대해 효율적이고 완전하며 중복 없는 이분군화 알고리즘이 부족한 문제를 해결하기 위해.
  • 기존 방법에서 정보 손실을 유발하는 이산화 또는 항목화와 같은 사전 처리 단계가 필요 없도록 제거하기 위해.
  • RIn-Close_CVC 알고리즘을 확장하여 혼합 속성 데이터를 처리하면서도 효율성, 완전성, 정확성, 중복 제거라는 네 가지 핵심 성질을 유지하기 위해.
  • 이분군화를 빈 패턴 채굴과 통합하여 사용자 우호적이고 해석 가능한 정량적 클래스 연관 규칙(QCARs)을 자동으로 생성하기 위해.
  • 채굴된 이분군이 레이블이 부여된 혼합 속성 데이터셋에 대해 간결하고 관련성 있으며 해석 가능한 모델을 생성하는 데 얼마나 유용한지 평가하기 위해.

제안 방법

  • 수치형 및 기호형 속성을 동시에 처리할 수 있도록 클로처 연산을 조정하여 RIn-Close_CVC 알고리즘을 혼합 속성 데이터셋을 지원하도록 확장한다.
  • 각 수치형 속성에 대해 개별적으로 사용자가 정의한 임계값을 적용하여 내부 일관성을 정의함으로써, 이분군 생성 과정에서 데이터 분포 특성을 유지한다.
  • 레이스터 기반의 열거 전략을 사용하여 중복 없이 모든 최대 이분군을 확보한다.
  • 신뢰도 및 리프트 지표를 사용하여 빈 패턴 채굴(FPM) 기법을 적용하여 간결하고 높은 관련성의 하위집합을 선택한다.
  • 채굴된 이분군을 정량적 클래스 연관 규칙(QCARs)으로 매핑하여 직관적인 해석을 가능하게 하며, 특히 레이블이 부여된 데이터셋에서 유용하다.
  • 클래스 레이블에 대해 강력한 분류 능력을 유지하면서도 중복을 최소화하는 소규모 대표 이분군 집합을 선택하기 위한 휴리스틱을 사용한다.

실험 결과

연구 질문

  • RQ1이산화 또는 사전 처리 없이도 혼합 속성 데이터셋에서 최대 이분군을 효율적이고 완전하게 채굴할 수 있는 열거형 이분군화 알고리즘이 존재하는가?
  • RQ2확장된 RIn-Close_CVC-Mix 알고리즘이 혼합 속성 데이터에 적용되었을 때 효율성, 완전성, 정확성, 중복 제거라는 네 가지 핵심 성질을 유지하는가?
  • RQ3이분군화와 빈 패턴 채굴을 통합하면 채굴된 이분군에서 해석 가능하고 고품질의 정량적 클래스 연관 규칙(QCARs)을 도출할 수 있는가?
  • RQ4채굴된 이분군에서 유도된 QCARs가 레이블이 부여된 혼합 속성 데이터셋에 대해 간결하고 관련성 있으며 해석 가능한 모델을 형성하는 데 얼마나 효과적인가?
  • RQ5클래스 레이블에 대해 강력한 분류 능력을 유지하면서도 중복을 최소화하는 소규모 대표 이분군 집합을 선택할 수 있는가?

주요 결과

  • 제안된 RIn-Close_CVC-Mix 알고리즘은 이산화 없이도 혼합 속성 데이터셋에서 모든 최대 이분군을 성공적으로 채굴하였으며, 원래 RIn-Close_CVC 알고리즘의 네 가지 핵심 성질을 유지하였다.
  • 알고리즘은 각 이분군에 대해 다항시간 복잡도를 유지하여, 혼합 속성 유형을 포함한 대규모 데이터셋에서도 효율성을 확보하였다.
  • 빈 패턴 채굴과의 통합을 통해 정량적 클래스 연관 규칙(QCARs)을 자동으로 생성할 수 있었으며, 이는 모델 이해에 있어 해석 가능하고 유용하였다.
  • 다섯 개인 레이블이 부여된 혼합 속성 데이터셋에서, QCARs는 높은 관련성과 낮은 중복성을 보이며 간결한 규칙 집합을 형성하였다.
  • Zoo 데이터셋에서는 'feathers{no}, milk{yes}, backbone{yes}, breathes{yes}, venomous{no} ⇒ 1'와 같은 규칙가 100% 신뢰도와 최대 25.25의 리프트 값을 기록하여 강력한 예측 능력을 보였다.
  • 대표 이분군 집합을 선택하기 위한 휴리스틱 기법이 중복을 효과적으로 줄였고, 동시에 클래스 레이블에 대한 강력한 분류 능력을 유지하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.