Skip to main content
QUICK REVIEW

[논문 리뷰] Deep Continuous Clustering

Sohil Shah, Vladlen Koltun|arXiv (Cornell University)|2018. 03. 05.
Advanced Clustering Algorithms Research참고 문헌 33인용 수 55
한 줄 요약

Deep Continuous Clustering (DCC)은 사전 설정된 클러스터 수를 필요로 하지 않는 강건한 연속 목적함수 하에 심층 오토인코더를 학습시켜 비선형 차원 축소와 클러스터링을 공동으로 학습하며, 고차원 데이터세트에서 강력한 성능을 보입니다.

ABSTRACT

Clustering high-dimensional datasets is hard because interpoint distances become less informative in high-dimensional spaces. We present a clustering algorithm that performs nonlinear dimensionality reduction and clustering jointly. The data is embedded into a lower-dimensional space by a deep autoencoder. The autoencoder is optimized as part of the clustering process. The resulting network produces clustered data. The presented approach does not rely on prior knowledge of the number of ground-truth clusters. Joint nonlinear dimensionality reduction and clustering are formulated as optimization of a global continuous objective. We thus avoid discrete reconfigurations of the objective that characterize prior clustering algorithms. Experiments on datasets from multiple domains demonstrate that the presented algorithm outperforms state-of-the-art clustering schemes, including recent methods that use deep networks.

연구 동기 및 목표

  • 인터포인트 간 거리가 덜 정보적이 된 고차원 공간에서의 클러스터링 동기 부여.
  • 단일 연속 목적함수를 최적화하는 공동 임베딩 및 클러스터링 프레임워크 개발.
  • 강건한 연속 클러스터링 공식화를 통해 사전에 클러스터 수를 알 필요 없게 하기.
  • 그래디언트 기반 솔버와 딥 네트워크를 통한 확장 가능한 최적화 가능하게 하기.

제안 방법

  • 매개변수 Θ로 표기된 심층 오토인코더를 사용해 데이터를 저차원 공간에 임베드합니다.
  • 저차원 표현 Y에서 X를 재구성할 수 있음을 보장하는 재구성 목적어를 통해 임베딩을 제약합니다.
  • 무리개 재배치 없이 클러스터링을 유도하는 대표자 Z 집합과 서로 다른 강건 손실을 사용하는 RCC 기반의 강건한 연속 클러스터링 목적함수를 통합합니다.
  • 재구성 손실, 데이터 손실, 그리고 쌍별 클러스터링 손실을 결합한 joint objective L(Ω, Z)를 정의하고 확률적 경사 방법으로 최적화합니다.
  • X에서 상호 kNN 그래프를 구성하고 비볼록 강건 M-추정기를 사용하여 내부 클러스터 응집 및 클러스터 간 분리를 촉진합니다.
  • 계단식 잡음 제거 오토인코더로 초기화하고 최적화를 용이하게 하기 위해 연속법을 적용하며, 클러스터 구조의 안정성에 기반해 종료합니다.

실험 결과

연구 질문

  • RQ1사전 클러스터 수를 지정하지 않고도 단일 연속 objective로 공동 비선형 임베딩과 클러스터링을 최적화할 수 있는가?
  • RQ2깊은 차원 축소를 클러스터링과 결합하는 것이 단계적(SDAE 임베딩 뒤 클러스터링) 접근법보다 더 나은 클러스터링 정확도를 얻는가?
  • RQ3전통적 클러스터링 손실과 비교하여 강건한 연속 클러스터링 목적함수가 고차원 데이터에서 어떤 성능을 보이는가?
  • RQ4잠재 공간 차원(d)의 변화가 데이터 세트 전반에 걸친 클러스터링 성능과 강건성에 어떤 영향을 미치는가?

주요 결과

  • DCC는 다수의 고차원 데이터세트에서 최첨단 기준선과 동등하거나 더 나은 클러스터링 성능을 보인다.
  • 임베딩과 클러스터링의 공동 최적화는 SDAE 임베딩을 단계별로 수행한 뒤 클러스터링하는 것보다 우수한 결과를 낳는다.
  • DCC는 잠재 공간의 차원 수에 대해 강건함을 보여 d가 증가해도 일부 기준선보다 우수하다.
  • 진정한 클러스터 수에 대한 사전 지식이 필요 없으나 학습된 공간에서 잘 정의된 클러스터 구조를 얻는다.
  • 합성곱(convolutional) 및 완전 연결(autoencoder) 구성은 실행 시간이 경쟁력 있으며 conv-DCC는 여러 심층 클러스터링 대안보다 빠르다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.