Skip to main content
QUICK REVIEW

[논문 리뷰] Categorization Axioms for Clustering Results

Yu Jian, Zongben Xu|arXiv (Cornell University)|2014. 03. 09.
Advanced Clustering Algorithms Research참고 문헌 40인용 수 3
한 줄 요약

이 논문은 분류 원칙에 기반한 형식적 공리적 프레임워크를 제안하여 클러스터링 결과를 적절한, 겹치는, 또는 부적절한 것으로 분류하는 분리 공리(axioms)를 도입한다. 클러스터링 알고리즘과 타당성 지표에 대한 세 가지 설계 원칙—분류 동치성, 밀도, 분리—을 수립하며, Xie-Beni 및 CVNN과 같은 주요 알고리즘과 지표들과의 일관성을 입증한다.

ABSTRACT

Cluster analysis has attracted more and more attention in the field of machine learning and data mining. Numerous clustering algorithms have been proposed and are being developed due to diverse theories and various requirements of emerging applications. Therefore, it is very worth establishing an unified axiomatic framework for data clustering. In the literature, it is an open problem and has been proved very challenging. In this paper, clustering results are axiomatized by assuming that an proper clustering result should satisfy categorization axioms. The proposed axioms not only introduce classification of clustering results and inequalities of clustering results, but also are consistent with prototype theory and exemplar theory of categorization models in cognitive science. Moreover, the proposed axioms lead to three principles of designing clustering algorithm and cluster validity index, which follow many popular clustering algorithms and cluster validity indices.

연구 동기 및 목표

  • 데이터 분석에서 오랫동안 남아온 클러스터링의 형식화 문제를 해결하기 위해 클러스터링 결과에 대한 통합된 공리적 프레임워크를 수립하는 것.
  • 사소하거나 비정상적인 결과를 방지하기 위해 분류 공리의 형식화를 통해 적절한 클러스터링 결과의 기준을 정의하는 것.
  • 원형 이론과 사례 기반 이론을 포함한 분류 이론과의 일치를 통해 클러스터링 이론을 인지과학과 연결하는 것.
  • 이론적 공리에서 유도된 일반 원칙을 바탕으로 클러스터링 알고리즘과 클러스터 타당성 지표를 설계하기 위한 원칙을 도출하는 것.
  • 널리 사용되는 클러스터링 방법과 지표들이 본 논문에서 제안한 공리들과 본질적으로 일치하거나 충족함을 보여주는 것.

제안 방법

  • 분류 동치성, 표본 분리, 클러스터 분리의 세 가지 핵심 공리를 도입하여 클러스터링 결과의 구조를 형식화한다.
  • 중첩된, 완전히 중첩된, 정보가 없는 분할과 같은 비정상적인 클러스터링 결과를 정의하여 열악한 해를 배제한다.
  • 표본 분리 공리에서 유도된 부등식을 통해 클러스터링 구조의 타당성을 정량화한다.
  • 분류 동치성, 클러스터의 밀도, 클러스터 분리의 세 가지 알고리즘 설계 원칙을 공리에 기반해 제안한다.
  • 기존의 클러스터링 알고리즘과 타당성 지표(예: 퍼지 C-평균, Xie-Beni 지수)를 분석하고 이론적 근거를 제공하기 위해 공리를 적용한다.
  • 원형 이론과 사례 기반 이론을 포함한 인지과학 이론을 활용하여 제안된 공리의 이론적 일관성을 검증한다.

실험 결과

연구 질문

  • RQ1어떤 형식적 공리들이 사소하거나 비정상적인 결과를 배제하면서 적절한 클러스터링 결과를 특징지울 수 있는가?
  • RQ2클러스터링 결과가 구조적 성질에 기반해 적절한, 겹치는, 또는 비정상적인 것으로 체계적으로 분류될 수 있는가?
  • RQ3기존의 클러스터링 알고리즘과 타당성 지표가 제안된 공리들과 얼마나 잘 일치하는가?
  • RQ4제안된 공리를 바탕으로 새로운 클러스터링 알고리즘과 타당성 지표를 위한 일반 설계 원칙을 도출할 수 있는가?
  • RQ5제안된 공리는 심리학 및 인지과학 분야의 인지 분류 이론과 어떻게 관련이 있는가?

주요 결과

  • 제안된 분류 공리들은 클러스터링 결과를 적절한, 겹치는, 비정상적인 것으로 성공적으로 분류하며, 비정상 결과에는 중첩된 분할과 정보가 없는 분할이 포함된다.
  • 표본 분리 공리는 클러스터링 결과의 구조적 타당성을 정량화하는 형식적 부등식을 유도한다.
  • Xie-Beni 지수가 분리 원칙과 밀도 원칙과 본질적으로 일치함이 입증되었으며, 분모에 의해 중첩된 클러스터를 처벌함으로써 이를 반영한다.
  • 퍼지 C-평균, 모델 기반 클러스터링 등 많은 인기 있는 클러스터링 알고리즘들이 제안된 밀도 및 분리 원칙을 암묵적으로 충족함이 확인되었다.
  • CVNN 클러스터 타당성 지표는 밀도와 분리를 동시에 최적화함으로써 제안된 원칙과 일치함이 밝혀졌다.
  • 공리적 프레임워크는 비정상적인 해를 피할 수 있는 새로운 클러스터링 알고리즘과 타당성 지표의 설계를 위한 이론적 기반을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.