[논문 리뷰] Adjusting the adjusted Rand Index -- A multinomial story
이 논문은 기존 Adjusted Rand Index(ARI)가 초기하분포에 의존하여 고정된 클러스터 크기를 강요하고 표본 추출의 랜덤성을 忽略한다는 통계적 한계를 해결하기 위해 다항분포 모델 기반으로 수정된 Adjusted Rand Index(MARI)를 제안한다. 유사성에 의해 일관된 쌍들에만 초점을 맞추고 더 현실적인 다항분포 모델에 따라 조정함으로써, 저자들은 MARI가 작은 표본 크기에서 ARI에 존재하는 편향을 제거하고, 더 해석 가능하고 탄탄하며 데이터 크기에 따라 효율적으로 확장 가능한 통계적으로 타당한 대안을 제공함을 보여준다.
The Adjusted Rand Index ($ARI$) is arguably one of the most popular measures for cluster comparison. The adjustment of the $ARI$ is based on a hypergeometric distribution assumption which is unsatisfying from a modeling perspective as (i) it is not appropriate when the two clusterings are dependent, (ii) it forces the size of the clusters, and (iii) it ignores randomness of the sampling. In this work, we present a new "modified" version of the Rand Index. First, we redefine the $MRI$ by only counting the pairs consistent by similarity and ignoring the pairs consistent by difference, increasing the interpretability of the score. Second, we base the adjusted version, $MARI$, on a multinomial distribution instead of a hypergeometric distribution. The multinomial model is advantageous as it does not force the size of the clusters, properly models randomness, and is easily extended to the dependant case. We show that the $ARI$ is biased under the multinomial model and that the difference between the $ARI$ and $MARI$ can be large for small $n$ but essentially vanish for large $n$, where $n$ is the number of individuals. Finally, we provide an efficient algorithm to compute all these quantities ($(A)RI$ and $M(A)RI$) by relying on a sparse representation of the contingency table in our exttt{aricode} package. The space and time complexity is linear in the number of samples and importantly does not depend on the number of clusters as we do not explicitly compute the contingency table.
연구 동기 및 목표
- 기존 ARI가 초기하분포에 의존하여 고정된 클러스터 크기를 강요하고 표본 추출의 랜덤성을 忽略한다는 통계적 한계를 해결하기 위해.
- 다른 클러스터링 간의 유사성에 의해 일관된 쌍들만 고려하여 더 해석 가능한 클러스터링 비교 척도를 개발하기 위해.
- 의존적인 클러스터링을 자연스럽게 수용하고 초기하분포 모델의 강력한 가정을 피할 수 있는 다항분포 기반 신규 조정된 Rand Index(MARI)를 제안하기 위해.
- ARI가 다항분포 모델 하에서 편향을 보이며, 특히 작은 표본 크기에서 이 편향이 심해지고 n이 증가함에 따라 점차 사라짐을 보여주기 위해.
- 희소 연도표 표현을 사용하여 ARI와 MARI를 모두 O(n) 시간과 공간 복잡도로 계산할 수 있는 효율적인 알고리즘을 제공하고, 이를 aricode R 패키지에 구현하기 위해.
제안 방법
- 유사성에 의해 일관된 쌍들(즉, 동일하거나 다른 클러스터에 있는 쌍들)만 세도록 Rand Index를 재설계하여, 차이에 의해 일관된 쌍들을 제거함으로써 해석 가능성 향상.
- 클러스터 할당의 다항분포 모델 하에서 Rand Index의 기대값을 유도함. 이 모델은 클러스터 크기를 고정하지 않으며 표본 추출의 랜덤성을 적절히 모델링함.
- 다항분포 모델 하에서의 기대값을 빼어 ARI의 편향을 보정함으로써 새로운 MARI 추정량 도출.
- 모든 척도(ARI, MARI)를 O(n) 시간과 공간 복잡도로 계산하기 위해 연도표의 희소 표현을 사용함. 이는 클러스터 수에 관계없이 적용 가능함.
- 다항분포 모델 하에서 ARI의 편향을 진짜 연도표 확률의 함수로 기술함으로써, 이 편향이 O(1/n)임을 보이고 점차적으로 사라짐을 증명함.
- 세 가지 다른 종속성 시나리오(비비례 대각선, 비비례 대각선에 비대칭 성분 포함, 한 행 또는 열이 비비례하지 않는 경우) 하에서 시뮬레이션을 통해 방법을 검증함. 이 경우 K와 n을 다양하게 변화시킴.
실험 결과
연구 질문
- RQ1클러스터 할당의 다항분포 모델 하에서 기존 ARI의 편향은 어떻게 행동하는가? 특히 작은 표본 크기에서 어떻게 되는가?
- RQ2클러스터 크기가 고정되어 있지 않고 표본 추출의 랜덤성이 존재할 때, ARI는 진짜 클러스터링 유사성보다 과대평가하거나 과소평가하는 정도는 어느 정도인가?
- RQ3다항분포 기반으로 새롭게 제안된 조정된 Rand Index(MARI)는 ARI에 내재된 편향을 제거하면서도 계산 효율성은 유지할 수 있는가?
- RQ4유사성에 의해 일관된 쌍들만 고려할 경우, Rand Index의 해석 가능성은 어떻게 향상되는가?
- RQ5MARI를 계산하는 데 드는 계산 복잡도는 ARI와 비교해 어떻게 되며, 전체 연도표를 명시적으로 구성하지 않고도 이를 달성할 수 있는가?
주요 결과
- ARI는 다항분포 모델 하에서 편향을 보이며, 이 편향은 8/n 이내로 제한되며, 이는 O(1/n)이므로 n → ∞ 일 때 점차 사라진다.
- 작은 n(예: n < 64)에서는 ARI의 편향이 상당히 크며, 절대값으로 최대 0.04에 이를 수 있어 오해의 소지가 있음.
- 작은 n에서는 ARI와 MARI 간의 차이가 뚜렷하지만, 표본 크기가 증가함에 따라 급격히 줄어들며, n > 200에서는 무시할 수 없을 정도로 미미해짐.
- MARI는 O(n) 시간과 공간 복잡도를 가지며, 희소 연도표 표현을 통해 효율적으로 계산 가능하여 명시적인 O(KL) 계산을 피함.
- MARI는 고정된 클러스터 크기를 가정하지 않으며, 표본 추출의 랜덤성을 적절히 모델링하고 의존적인 클러스터링으로도 자연스럽게 확장 가능하므로 통계적으로 더 탄탄함.
- 세 가지 시나리오(비비례 대각선, 비비례 대각선에 비대칭 성분 포함, 한 행 또는 열이 비비례하지 않는 경우)에 걸친 시뮬레이션을 통해 대부분의 K와 n에서 편향은 중간 정도로 유지되나, 특히 작은 표본, 높은 불균형 설정에서 가장 두드러짐.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.