Skip to main content
QUICK REVIEW

[논문 리뷰] One-Pass Incomplete Multi-view Clustering

Menglei Hu, Songcan Chen|arXiv (Cornell University)|2019. 03. 02.
Face and Expression Recognition참고 문헌 35인용 수 8
한 줄 요약

이 논문은 정규화 및 가중치가 부여된 행렬 분해를 활용하여 누락된 인스턴스를 효율적으로 처리하는 대규모 불완전 다중뷰 클러스터링을 위한 원패스 프레임워크인 OPIMC를 제안한다. 두 가지 전역 통계를 도입함으로써 OPIMC는 직접 클러스터링 출력과 조기 수렴 검출을 가능하게 하여, 네 개인 실세계 데이터셋에서 최신 기술 수준의 성능을 달성하며 시간과 메모리 사용을 크게 줄였다.

ABSTRACT

Real data are often with multiple modalities or from multiple heterogeneous sources, thus forming so-called multi-view data, which receives more and more attentions in machine learning. Multi-view clustering (MVC) becomes its important paradigm. In real-world applications, some views often suffer from instances missing. Clustering on such multi-view datasets is called incomplete multi-view clustering (IMC) and quite challenging. To date, though many approaches have been developed, most of them are offline and have high computational and memory costs especially for large scale datasets. To address this problem, in this paper, we propose an One-Pass Incomplete Multi-view Clustering framework (OPIMC). With the help of regularized matrix factorization and weighted matrix factorization, OPIMC can relatively easily deal with such problem. Different from the existing and sole online IMC method, OPIMC can directly get clustering results and effectively determine the termination of iteration process by introducing two global statistics. Finally, extensive experiments conducted on four real datasets demonstrate the efficiency and effectiveness of the proposed OPIMC method.

연구 동기 및 목표

  • 기존 오프라인 방법이 높은 계산 및 메모리 비용으로 인해 고비용이 되는 대규모 다중뷰 데이터셋에서 누락된 인스턴스가 존재하는 클러스터링 문제를 해결한다.
  • 재처리가 필요 없고 시간 복잡도를 낮추는 온라인이고 확장 가능한 불완전 다중뷰 클러스터링 솔루션을 개발한다.
  • 반복 검증이나 고정된 반복 횟수에 의존하지 않고 직접 클러스터링 출력과 자동 수렴 검출을 가능하게 한다.
  • 다양한 뷰에서 온 데이터가 종종 누락되는 실세계 응용 분야에서의 강건성과 효율성을 향상시킨다.
  • 웹 마이닝 및 영상 분석과 같은 스트리밍 또는 대규모 데이터 시나리오에 적합한 실용적인 프레임워크를 제공한다.

제안 방법

  • OPIMC는 불완전한 다중뷰 데이터로부터 저랭크 표현을 학습하기 위해 정규화된 행렬 분해(RMF)를 사용하여 뷰 간 일관성을 유지한다.
  • 누락된 항목을 처리하기 위해 가중치가 부여된 행렬 분해(WMF)를 사용하며, 최적화 과정에서 볼 수 없는 인스턴스에 낮은 가중치를 할당한다.
  • 수렴 모니터링과 조기 종료를 가능하게 하기 위해 누적 손실과 클러스터 중심 안정성이라는 두 가지 전역 통계를 도입한다.
  • 데이터를 블록 단위로 처리함으로써 최소한의 메모리 사용량으로 원패스 학습을 가능하게 한다.
  • 목적 함수는 뷰별 재구성 오차, 인자 행렬에 대한 정규화, 그리고 데이터 무결성과 매끄러움 사이의 트레이드오프를 제어하는 균형 매개변수 α를 통합한다.
  • OPIMC는 데이터 블록 단위로 인자 행렬을 점진적으로 업데이트하여 스트리밍 또는 대규모 데이터 처리에 적합하다.

실험 결과

연구 질문

  • RQ1대규모 데이터셋에서 높은 확장성과 낮은 메모리 사용량을 확보하면서도 원패스 프레임워크가 불완전한 다중뷰 클러스터링을 효과적으로 처리할 수 있는가?
  • RQ2전체 데이터 패assing이나 검증이 필요 없이 전역 통계를 어떻게 사용하여 자동으로 수렴을 판단할 수 있는가?
  • RQ3정규화 및 가중치가 부여된 행렬 분해의 통합이 불완전한 다중뷰 데이터에서 클러스터링 성능을 얼마나 향상시키는가?
  • RQ4블록 크기가 원패스 환경에서 클러스터링 정확도와 수렴 속도에 어떤 영향을 미치는가?
  • RQ5처리 중에 열악해진 클러스터 중심을 채우는 것이 클러스터링 안정성과 성능에 상당한 영향을 미치는가?

주요 결과

  • OPIMC는 WebKB, Digit, Reuters, YouTube 네 개인 실세계 데이터셋에서 기존 오프라인 및 온라인 방법보다 최신 기술 수준의 클러스터링 성능을 달성한다.
  • 클러스터링 성능에 최적의 초모수 α는 WebKB에서는 10, Digit에서는 0.1, Reuters에서는 0.01, YouTube에서는 1로, 각 뷰에 따라 민감도가 다름을 확인하였다.
  • 두 전역 통계를 통해 수렴이 신뢰성 있게 검출되었으며, 평균 손실은 약 5~10회 반복 후 안정화되었고, NMI와 조정된 랜드 지수(AC) 역시 손실 수렴과 일치하는 안정된 값을 도달하였다.
  • 더 큰 블록 크기(s=250)는 Digit 데이터셋에서 더 나은 클러스터링 결과를 얻었지만, 메모리 사용 증가를 수반하였다.
  • 처리 중에 열악해진 클러스터 중심을 채운 OPIMC-F는 중심 안정성이 온라인 학습에서 중요함을 입증하며, 비채움 대비 성능 향상이 뚜렷했다.
  • 효율적인 조기 정지 덕분에 오프라인 방법 대비 클러스터링 시간을 크게 줄였고, 더 적은 반복 횟수 내에 수렴을 달성하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.