Skip to main content
QUICK REVIEW

[논문 리뷰] A fast and recursive algorithm for clustering large datasets with $k$-medians

Hervé Cardot, Peggy Cénac|arXiv (Cornell University)|2011. 01. 21.
Advanced Clustering Algorithms Research참고 문헌 19인용 수 6
한 줄 요약

이 논문은 대규모 고차원 데이터셋을 순차적으로 처리할 수 있는 빠르고 재귀적인 확률적 경사하강 알고리즘을 제안한다. 이 알고리즘은 O(kn)의 계산 복잡도를 가지며, k-median 기준의 정적점으로 거의 확실히 수렴한다. 이는 로빈스-몬로 확률적 근사법을 활용한 것으로, 단계 크기 자동 선택 절차와 평균화를 통한 성능 향상으로 인해 k-means, 트림드 k-means, PAM보다 빠르고 강인한 성능을 보였다. 실제 TV 시청자 데이터에서의 성능 평가 결과, 이 알고리즘은 실시간으로 의미 있는 시청자 프로파일을 성공적으로 식별하였다.

ABSTRACT

Clustering with fast algorithms large samples of high dimensional data is an important challenge in computational statistics. Borrowing ideas from MacQueen (1967) who introduced a sequential version of the $k$-means algorithm, a new class of recursive stochastic gradient algorithms designed for the $k$-medians loss criterion is proposed. By their recursive nature, these algorithms are very fast and are well adapted to deal with large samples of data that are allowed to arrive sequentially. It is proved that the stochastic gradient algorithm converges almost surely to the set of stationary points of the underlying loss criterion. A particular attention is paid to the averaged versions, which are known to have better performances, and a data-driven procedure that allows automatic selection of the value of the descent step is proposed. The performance of the averaged sequential estimator is compared on a simulation study, both in terms of computation speed and accuracy of the estimations, with more classical partitioning techniques such as $k$-means, trimmed $k$-means and PAM (partitioning around medoids). Finally, this new online clustering technique is illustrated on determining television audience profiles with a sample of more than 5000 individual television audiences measured every minute over a period of 24 hours.

연구 동기 및 목표

  • 대규모 고차원 데이터셋을 효율적이고 강인하게 군집화하는 데 도전 과제를 해결하기 위해.
  • 모든 데이터를 저장하지 않고도 선형 시간 복잡도로 증가하는 표본 크기에 비례하는 순차적이고 재귀적인 k-median 알고리즘을 개발하기 위해.
  • 평균화된 확률적 경사 추정기와 데이터 기반 단계 크기 선택을 통해 수렴성과 성능을 향상시키기 위해.
  • 제곱 오차 대신 L1-노름을 최소화함으로써 이상치에 덜 민감한 k-means의 강인한 대안을 제공하기 위해.
  • 24시간 동안 5,000명 이상의 TV 시청자를 모니터링한 실제 데이터셋을 바탕으로 본 방법의 실용적 유용성을 입증하기 위해.

제안 방법

  • MacQueen의 순차적 k-means 아이디어를 L1-손실 기준에 대한 확률적 경사하강을 사용하여 k-median로 확장한다.
  • 재귀적 업데이트 규칙을 적용: $ X_{n+1}^{r} = X_n^r - a_n^r \frac{X_n^r - Z_n}{\|X_n^r - Z_n\|} $, 여기서 $ Z_n $이 군집 $ r $에 할당된 경우이며, $ a_n^r $은 단계 크기이다.
  • 수렴성과 추정 정확도를 향상시키기 위해 평균화된 추정기를 사용하여 재귀적 업데이트의 분산을 줄인다.
  • 실험적 L1 손실 기반으로 데이터 기반 절차를 도입하여 내림값 단계 크기를 자동으로 선택한다.
  • 로빈스-몬로 확률적 근사 프레임워크를 적용하여 k-median 목적함수의 정적점으로 거의 확실히 수렴함을 증명한다.
  • 이중 단계 절차를 구현: 먼저 순차적 k-means를 실행하여 초기 단계 크기를 추정하고, 그 다음 k-median 알고리즘을 적용한다.

실험 결과

연구 질문

  • RQ1재귀적이고 온라인인 k-median 군집화 알고리즘이 PAM이나 트림드 k-means와 같은 배치 방법과 유사한 정확도를 달성하면서도 훨씬 더 빠른가?
  • RQ2평균화된 순차적 k-median 추정기의 성능은 k-means, 트림드 k-means, PAM에 비해 계산 속도와 추정 정확도 측면에서 어떻게 다른가?
  • RQ3데이터 기반의 자동 단계 크기 선택 절차가 수동 조정 없이도 재귀적 k-median 군집화의 강인성과 수렴성을 향상시킬 수 있는가?
  • RQ4고차원 및 대규모 표본 조건 하에서 재귀적 k-median 알고리즘이 안정성과 수렴 성질을 유지하는가?
  • RQ5실제 데이터에서 k-means에 비해 k-median 접근법이 이상치에 얼마나 덜 민감한가?

주요 결과

  • 제안된 재귀적 k-median 알고리즘은 O(kn)의 계산 복잡도를 가지며, 대규모 데이터셋에 매우 스케일이 잘 되어 있다.
  • 모의 실험에서 평균화된 알고리즘은 k-means, 트림드 k-means, PAM에 비해 추정 정확도 측면에서 뛰어난 성능을 보였다.
  • 약한 정규성 조건 하에서 k-median 손실 기준의 정적점 집합으로 거의 확실히 수렴한다.
  • 실험적 L1 손실 기반의 데이터 기반 단계 크기 선택 절차는 수동 조정 없이도 성능을 향상시켰다.
  • 5,000명 이상의 개인이 포함된 실제 TV 시청자 데이터에서, 알고리즘은 실시간으로 의미 있는 시청자 프로파일을 성공적으로 식별하여 온라인 군집화에 적합함을 입증하였다.
  • L1-노름을 사용함으로써 k-means보다 이상치에 더 강인하며, 선형 시간 복잡도를 유지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.