Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-View Multiple Clusterings using Deep Matrix Factorization

Shaowei Wei, Jun Wang|arXiv (Cornell University)|2019. 11. 26.
Face and Expression Recognition참고 문헌 36인용 수 8
한 줄 요약

이 논문은 다중 시각 데이터로부터 다수의 다양하고 고품질의 클러스터링을 계층적으로 행렬 분해하면서 균형 잡힌 재중복 측정 항목을 통해 다양성을 강제함으로써 다층 행렬 분해 프레임워크인 DMClusts를 제안한다. 실험 결과, 기준 데이터셋에서 최신 기술 대비 클러스터링 품질과 다양성 측면에서 뛰어난 성능을 보였다.

ABSTRACT

Multi-view clustering aims at integrating complementary information from multiple heterogeneous views to improve clustering results. Existing multi-view clustering solutions can only output a single clustering of the data. Due to their multiplicity, multi-view data, can have different groupings that are reasonable and interesting from different perspectives. However, how to find multiple, meaningful, and diverse clustering results from multi-view data is still a rarely studied and challenging topic in multi-view clustering and multiple clusterings. In this paper, we introduce a deep matrix factorization based solution (DMClusts) to discover multiple clusterings. DMClusts gradually factorizes multi-view data matrices into representational subspaces layer-by-layer and generates one clustering in each layer. To enforce the diversity between generated clusterings, it minimizes a new redundancy quantification term derived from the proximity between samples in these subspaces. We further introduce an iterative optimization procedure to simultaneously seek multiple clusterings with quality and diversity. Experimental results on benchmark datasets confirm that DMClusts outperforms state-of-the-art multiple clustering solutions.

연구 동기 및 목표

  • 기존의 다중 시각 클러스터링 방법이 단일 클러스터링에 집중함으로써 일반적으로 다수의 의미 있고 다양한 클러스터링을 지원하지 못하는 문제를 해결하기 위해, 다중 시각 데이터로부터 다수의 의미 있고 다양한 클러스터링을 발견하는 것을 목적으로 한다.
  • 다양한 이질적 시각 간의 공통 및 상보적 정보를 효과적으로 융합하면서도 노이즈가 많거나 저품질의 시각에 대해 강건한 방법을 개발하는 것을 목적으로 한다.
  • 다양한 클러스터링 간의 재중복을 동시에 측정함으로써, 샘플이 서로 같은 클러스터에 속하거나 다른 클러스터에 나뉘어지는 경우를 종합적으로 고려하여 다양성을 강제하는 것을 목적으로 한다.
  • 기존 접근 방식에서 유사도 행렬 분해의 계산 부담을 피할 수 있는 효율적이고 확장 가능한 솔루션을 설계하는 것을 목적으로 한다.

제안 방법

  • DMClusts는 다중 시각 데이터 행렬을 계층적으로 표현 공간으로 분해함으로써, 각 레이어마다 하나의 클러스터링을 생성하는 방식으로 다층 행렬 분해를 활용한다.
  • 두 샘플이 서로 같은 클러스터에 속하거나 다른 클러스터에 나뉘는 경우를 종합적으로 측정하는 새로운 균형 잡힌 재중복 측정 항목을 도입하여 포괄적인 다양성을 촉진한다.
  • 클러스터링 품질과 낮은 재중복을 동시에 확보하는 반복 최적화 절차를 사용하여 다양성과 클러스터링 성능 간의 트레이드오프를 균형 잡는다.
  • 학습 가능한 파라미터 $ r $ 를 통해 각 시각에 다른 가중치를 할당하여, 관련성이 없거나 노이즈가 많은 시각을 낮추고 강건성을 향상시킨다.
  • 클러스터링 품질(행렬 분해를 통한)과 다양성(재중복 제어를 통한) 간의 균형을 조절하기 위해 하이퍼파rameter $ \lambda $ 를 통합한다.
  • 재구성 오차와 재중복을 최소화하는 목적 함수를 사용하여 엔드 투 엔드로 모델을 훈련하며, 반복 최적화를 통해 수렴이 보장된다.

실험 결과

연구 질문

  • RQ1다층 행렬 분해 프레임워크는 다중 시각 데이터로부터 다수의 다양하고 고품질의 클러스터링을 효과적으로 생성할 수 있는가?
  • RQ2샘플의 함께 그룹화 및 분리 패턴을 모두 반영하여, 다수의 클러스터링 간의 재중복을 어떻게 측정할 수 있는가?
  • RQ3동일 클러스터 및 다른 클러스터 그룹화를 모두 고려하는 제안된 균형 잡힌 재중복 항목이 기존 방법보다 더 나은 다양성을 제공하는가?
  • RQ4클러스터링 품질과 다양성 측면에서, 제안된 방법은 최신 기술의 다중 클러스터링 및 다중 시각 클러스터링 방법과 비교해 어떻게 성능을 내는가?
  • RQ5학습 가능한 파rameter $ r $ 를 통해 노이즈가 많거나 저품질의 시각에 낮은 가중치를 할당함으로써, 프레임워크는 이러한 시각을 효과적으로 처리할 수 있는가?

주요 결과

  • DMClusts는 기준 데이터셋에서 최신 기술 대비 클러스터링 품질(Davies-Bouldin Index)과 다양성(1-NMI) 측면에서 뚜렷이 뛰어난 성능을 보이며, 뛰어난 효과성을 입증하였다.
  • 특히 $ \beta \in [0.3, 0.7] $ 범위에서 균형 잡힌 재중복 측정 항목이 $ \beta = 0 $ 또는 $ \beta = 1 $ 와 같은 극단적 값보다 더 높은 다양성(NMI ≈ 0.064)을 달성하여, 보완적인 재중복 패턴을 효과적으로 포착함을 입증하였다.
  • 하이퍼파rameter $ \lambda $ 는 품질과 다양성 간의 트레이드오프를 제어한다: $ \lambda $ 를 증가시킬수록 다양성은 향상되지만 클러스터링 품질은 감소하며, 이는 본질적인 딜레마와 이 하이퍼파라미터의 필요성을 확인한다.
  • 모델은 다양한 $ r $ 에서 안정적인 성능을 유지하며, 중간 정도의 값($ r > 0.05 $)이 시각 별 가중치 할당을 가능하게 하여 다양성을 향상시키지만, 매우 작은 $ r $ 는 동일 가중치를 유도하고 다양성을 감소시킨다.
  • DMClusts 는 효율성과 성능 사이에 좋은 균형을 이루며, 유사도 행렬 기반 방법 대비 양호한 확장성과 중간 수준의 런타임을 확보하여 대규모 데이터셋에 적합하다.
  • 제거 실험을 통해, 동일 클러스터 및 다른 클러스터 내 재중복를 모두 고려하는 제안된 재중복 항목이 기준 대비 클러스터링 다양성 향상에 기여한다는 것이 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.