Skip to main content
QUICK REVIEW

[논문 리뷰] Clustering Validation with The Area Under Precision-Recall Curves

Pablo Andretta Jaskowiak, Ivan G. Costa|arXiv (Cornell University)|2023. 04. 04.
Data-Driven Disease Surveillance인용 수 4
한 줄 요약

이 논문은 클러스터 크기 불균형 상황에서도 특히 효과적인 상대적 클러스터링 검증 지표(CVIs)로 정밀도-재현율 곡선 아래 면적(AUPR)과 그 대칭형 변형(SAUPRC)을 제안한다. AUPR 기반 CVI, 특히 SAUPRC가 실루엣(Silhouette)과 AUCC와 같은 기존 지표보다 균형 잡힌 데이터와 불균형 데이터 모두에서 뛰어난 성능을 보이며, 비지도 학습 평가를 위한 통합적이고 신뢰할 수 있는 프레임워크를 제공한다.

ABSTRACT

Confusion matrices and derived metrics provide a comprehensive framework for the evaluation of model performance in machine learning. These are well-known and extensively employed in the supervised learning domain, particularly classification. Surprisingly, such a framework has not been fully explored in the context of clustering validation. Indeed, just recently such a gap has been bridged with the introduction of the Area Under the ROC Curve for Clustering (AUCC), an internal/relative Clustering Validation Index (CVI) that allows for clustering validation in real application scenarios. In this work we explore the Area Under Precision-Recall Curve (and related metrics) in the context of clustering validation. We show that these are not only appropriate as CVIs, but should also be preferred in the presence of cluster imbalance. We perform a comprehensive evaluation of proposed and state-of-art CVIs on real and simulated data sets. Our observations corroborate towards an unified validation framework for supervised and unsupervised learning, given that they are consistent with existing guidelines established for the evaluation of supervised learning models.

연구 동기 및 목표

  • 지도 학습에서와 유사한 종합적인 평가 프레임워크가 부족한 점을 보완하기 위해.
  • 정밀도-재현율 곡선 기반 지표(AUPR)가 클러스터 크기 불균형 상황에서도 상대적 CVI로서 효과적인지 조사하기 위해.
  • 클러스터링 검증을 지도 학습에서의 기존 관행과 통합하는 통일된 평가 프레임워크를 제공하기 위해.
  • 다양한 불균형 수준을 가진 시뮬레이션 데이터와 실제 데이터에서 AUPR 기반 CVI의 성능을 최신 기준 지표들과 비교하기 위해.
  • SAUPRC가 균형 잡힌 데이터와 불균형 데이터 모두에서 뛰어난 성능를 보이며 일반적인 클러스터링 검증에 강력한 선택지가 될 수 있음을 입증하기 위해.

제안 방법

  • 정밀도-재현율 곡선 아래 면적(AUPRC) 기반으로 세 가지 새로운 상대적 CVI를 제안하며, 이 중 AUPRC와 AUIPRC를 조합한 대칭형 변형(SAUPRC)을 포함한다.
  • 클러스터 할당을 기준 분할에 대한 이진 예측으로 간주함으로써 이진 분류에서의 정밀도-재현율 곡선 프레임워크를 클러스터링에 적용한다.
  • 외부 기준 분할을 기준으로 하여 모든 객체 쌍 간의 클러스터 할당을 평가함으로써 AUPR 및 AUIPRC 점수를 계산한다.
  • AUPRC와 AUIPRC를 평균화하여 균형 잡힌 데이터와 불균형 데이터 모두에서 성능를 균형 있게 유지하는 하이브리드 지표로 대칭 AUPRC(SAUPRC)를 사용한다.
  • 통제된 클러스터 불균형을 가진 시뮬레이션 데이터와 타부라 무리스(Tabula Muris) 프로젝트의 실제 단세포 RNA-seq 데이터에 제안된 CVI를 적용한다.
  • 조정된 랜드 지수(ARI)를 외부 기준으로 삼아 제안된 CVI를 기존 지표(Silhouette, AUCC, Dunn, C-Index)와 비교한다.
Figure 2: Characterization of cluster size imbalance in the distinct evaluation scenarios.
Figure 2: Characterization of cluster size imbalance in the distinct evaluation scenarios.

실험 결과

연구 질문

  • RQ1정밀도-재현율 곡선 아래 면적(AUPR)이 신뢰할 수 있는 상대적 클러스터링 검증 지표로 기능할 수 있는가?
  • RQ2클러스터 크기 불균형 정도가 다양할 때 AUPR 기반 CVI는 기존 CVI보다 어떻게 성능을 보이는가?
  • RQ3AUPRC와 AUIPRC를 조합한 대칭 AUPRC(SAUPRC)는 균형 잡힌 데이터와 불균형 데이터 모두에서 뛰어난 안정성과 성능를 제공하는가?
  • RQ4AUPR 기반 지표는 특히 불균형 설정에서 지도 학습에서 널리 사용되는 평가 지침과 어느 정도 일치하는가?
  • RQ5단세포 게놈학 데이터와 같이 내재된 클러스터 불균형을 가진 실제 생물학적 데이터에 AUPR 기반 CVI를 효과적으로 적용할 수 있는가?

주요 결과

  • 균형 잡힌 데이터에서도 SAUPRC는 조정된 랜드 지수(ARI)와의 중앙값 상관관계가 0.75를 초과하여 실루엣과 AUCC와 같은 기존 CVI를 능가했다.
  • 매우 불균형한 데이터(90% 불균형)에서는 SAUPRC가 중앙값 상관관계가 1.0에 가까워져 외부 기준과의 강한 일치를 보였다.
  • 클러스터 불균형이 증가함에 따라 AUPRC와 SAUPRC의 성능이 향상되었으며, 중앙값 상관관계가 균형 잡힌 경우 약 0.75에서 90% 불균형일 경우 약 0.95로 상승했다.
  • 반면 PB(포인트 이분산)와 PBM CVI의 성능는 불균형이 심화되면서著격히 악화되어 90% 불균형에서 중앙값 상관관계가 -1.0까지 떨어졌다.
  • AUCC와 DB는 불균형 수준에 관계없이 안정적인 성능를 보였지만, 균형 잡힌 데이터와 불균형 데이터 모두에서 SAUPRC에 밀렸다.
  • C/Sqrt(k)는 균형 잡힌 데이터에서는 ARI와 부정적 일치를 보였지만 불균형이 증가함에 따라 성능이 향상되었으며, 중앙값 상관관계는 여전히 0.5 이하에 머물러 있어 중간 수준의 성능를 보였다.
Figure 3: Boxplots depict correlation between the evaluations of each relative CVI and those of the Adjusted Rand Index (ARI), i.e., the external CVI. Results are sorted according to the average correlation value, which is indicated by a circle in each boxplot.
Figure 3: Boxplots depict correlation between the evaluations of each relative CVI and those of the Adjusted Rand Index (ARI), i.e., the external CVI. Results are sorted according to the average correlation value, which is indicated by a circle in each boxplot.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.