Skip to main content
QUICK REVIEW

[논문 리뷰] Shallow decision trees for explainable $k$-means clustering

Eduardo Sany Laber, Lucas Murtinho|arXiv (Cornell University)|2021. 12. 29.
Rough Sets and Fuzzy Logic인용 수 6
한 줄 요약

이 논문은 $k$-means 비용과 설명 가능성 메트릭인 가중 평균 깊이(WAD) 및 가중 평균 설명 크기(WAES)를 동시에 최소화하는 효율적인 설명 가능한 $k$-means 클러스터링 알고리즘인 ExShallow를 제안한다. 얕은 결정 트리를 구성함으로써 기존 방법에 비해 유사하거나 더 나은 클러스터링 품질을 달성하면서도 트리의 깊이를 크게 줄여 성능을 희생시키지 않은 채 해석 가능성성을 향상시킨다.

ABSTRACT

A number of recent works have employed decision trees for the construction of explainable partitions that aim to minimize the $k$-means cost function. These works, however, largely ignore metrics related to the depths of the leaves in the resulting tree, which is perhaps surprising considering how the explainability of a decision tree depends on these depths. To fill this gap in the literature, we propose an efficient algorithm that takes into account these metrics. In experiments on 16 datasets, our algorithm yields better results than decision-tree clustering algorithms such as the ones presented in \cite{dasgupta2020explainable}, \cite{frost2020exkmc}, \cite{laber2021price} and \cite{DBLP:conf/icml/MakarychevS21}, typically achieving lower or equivalent costs with considerably shallower trees. We also show, through a simple adaptation of existing techniques, that the problem of building explainable partitions induced by binary trees for the $k$-means cost function does not admit an $(1+ε)$-approximation in polynomial time unless $P=NP$, which justifies the quest for approximation algorithms and/or heuristics.

연구 동기 및 목표

  • 기존 연구에서 설명 가능한 결정 트리 클러스터링에 있어 잎 노드 깊이 메트릭에 대한 관심이 부족한 점을 해결하기 위해.
  • 모든 $k$-means 비용과 WAD, WAES와 같은 설명 가능성 메트릭을 동시에 최소화하는 알고리즘을 개발하기 위해.
  • $\lambda$라는 파라미터를 통해 클러스터링 품질과 트리 깊이 사이의 조절 가능한 트레이드오프를 제공하기 위해.
  • 기존의 설명 가능한 클러스터링 알고리즘보다 더 낮은 비용과 훨씬 얕은 트리를 생성함으로써 성능을 향상시키기 위해.
  • 계산 효율성을 확보하면서도 결정 트리를 활용한 $k$-means 클러스터링의 해석 가능성성을 향상시키기 위해.

제안 방법

  • 알고리즘은 루트에서부터 하향식으로 결정 트리를 구축하며, Lloyd 알고리즘을 통해 확보한 설명 불가능한 $k$-means 분할을 기반으로 한다.
  • 각 노드에서, $k$-means 비용, WAD, WAES 사이의 트레이드오프를 최적화하는 컷(차원 및 임계값)을 선택하며, 이는 조정 가능한 파라미터 $\lambda$에 의해 제어된다.
  • 잠재적 컷이 WAD 및 WAES에 미치는 영향을 추정하기 위한 효율적인 평가 방법을 도입하여, 열 劣한 분할을 신속하게 제거한다.
  • 클러스터링 비용과 깊이 기반 설명 가능성 메트릭을 결합한 가중 비용 함수를 사용하여 제어 가능한 트레이드오프를 가능하게 한다.
  • 각 데이터셋에 대해 $\lambda$를 최적화하기 위해 이진 탐색을 활용하며, 이로 인해 기준 방법 대비 비용 및 설명 가능성 측면에서 더 뛰어난 성능을 달성한다.
  • 계산 효율성이 뛰어나, 다른 최신 기술과 유사한 실행 시간을 보이며 실용적인 구현이 가능하도록 설계되었다.

실험 결과

연구 질문

  • RQ1가장 중요한 $k$-means 비용과 WAD, WAES와 같은 잎 노드 깊이 메트릭을 동시에 최소화하는 설명 가능한 클러스터링 알고리즘을 설계할 수 있는가?
  • RQ2깊이 기반 설명 가능성 메트릭을 포함할 경우, 결정 트리 기반 클러스터링의 성능과 해석 가능성에 어떤 영향을 미치는가?
  • RQ3클러스터링 품질을 떨어뜨리지 않고도 기존 방법보다 더 나은 해석 가능성을 달성할 수 있는가?
  • RQ4트레이드오프 파라미터 $\lambda$의 튜닝이 클러스터링 비용과 트리 깊이 사이의 균형에 어떤 영향을 미치는가?
  • RQ5제안된 알고리즘이 실세계 데이터셋에 대해 실용적으로 사용 가능한 정도로 계산 효율성이 충분한가?

주요 결과

  • 16개의 데이터셋에서 ExShallow는 기존 최고의 방법들과 유사하거나 더 낮은 $k$-means 비용을 달성했으며, WAES와 WAD에서 통계적으로 유의미한 향상을 보였다.
  • Avila 데이터셋의 경우, ExShallow는 WAES를 ExGreedy의 5.4에서 3.7로, WAD를 6.2에서 3.8로 감소시켜 설명 가능성 측면에서 뚜렷한 향상을 보였다.
  • 최적화된 $\lambda$를 사용한 ExShallow는 16개 데이터셋 중 10개에서 KMC보다 낮은 정규화된 분할 비용(NPC)을 달성했으며, 동시에 WAES와 WAD도 향상시켰다.
  • ExShallow는 중앙값 정규화된 분할 비용 1.15를 기록했으며, ExGreedy(1.17)와 IMM(1.16)를 모두 앞서며, WAES(3.35 vs. 3.63)와 WAD(3.58 vs. 3.72)에서도 유의미하게 낮은 수준을 기록했다.
  • 실행 시간은 경쟁력 있었으며, ExShallow의 평균 실행 시간(2.65초)은 ExGreedy(3.81초)와 유사했고 IMM(3.22초)보다 빠르게, 실세계 적용에 적합한 수준이었다.
  • ExShallow는 해석 가능성 메트릭에서 항상 ExGreedy와 IMM을 앞서며, 클러스터링 품질 측면에서도 이를 따라하거나 초월하여, 비용과 해석 가능성의 균형을 잘 잡는 데서 그 우월성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.