[논문 리뷰] Clustering on Multiple Incomplete Datasets via Collective Kernel Learning
이 논문은 공통 인스턴스 간 정렬을 통해 반복적으로 커널 행렬을 보완함으로써 다수의 불완전한 데이터셋을 클러스터링하는 Collective Kernel Learning (CoKL)을 제안한다. 어떤 데이터셋도 완전하지 않은 상황에서도 기존 방법 대비 최대 2배 높은 정규화 상호정보량(NMI)을 달성한다.
Multiple datasets containing different types of features may be available for a given task. For instance, users' profiles can be used to group users for recommendation systems. In addition, a model can also use users' historical behaviors and credit history to group users. Each dataset contains different information and suffices for learning. A number of clustering algorithms on multiple datasets were proposed during the past few years. These algorithms assume that at least one dataset is complete. So far as we know, all the previous methods will not be applicable if there is no complete dataset available. However, in reality, there are many situations where no dataset is complete. As in building a recommendation system, some new users may not have a profile or historical behaviors, while some may not have a credit history. Hence, no available dataset is complete. In order to solve this problem, we propose an approach called Collective Kernel Learning to infer hidden sample similarity from multiple incomplete datasets. The idea is to collectively completes the kernel matrices of incomplete datasets by optimizing the alignment of the shared instances of the datasets. Furthermore, a clustering algorithm is proposed based on the kernel matrix. The experiments on both synthetic and real datasets demonstrate the effectiveness of the proposed approach. The proposed clustering algorithm outperforms the comparison algorithms by as much as two times in normalized mutual information.
연구 동기 및 목표
- 모든 데이터셋이 불완전한 상황에서 클러스터링을 수행하는 문제에 대응하는 것. 이는 기존의 다중뷰 클러스터링 방법이 다루지 못하는 상황이다.
- 기존 방법들이 최소한 하나의 완전한 데이터셋이 필요하다는 한계를 극복하는 것.
- 결측 특성 값을 직접 보간하지 않고도 효율적인 반복적 방법으로 커널 행렬을 보완하는 것.
- 공동 커널 학습을 커널 공분산 분석(Kernel Canonical Correlation Analysis, KCCA)과 통합하여 클러스터링 성능을 향상시키는 것.
제안 방법
- 다양한 데이터셋 간 공통 인스턴스의 유사도를 정렬함으로써 공동 커널 학습을 사용해 불완전한 커널 행렬을 보완한다.
- 다양한 데이터셋 간 겹치는 인스턴스의 커널 행렬 간 이질성을 최소화하는 최적화 문제를 수립한다.
- 결측 항목의 초기 추정치를 사용하여 제약 조건이 붙은 최적화 문제를 반복적으로 해결하여 커널 행렬을 업데이트한다.
- 완성된 커널 행렬에 대해 커널 공분산 분석(KCCA)을 적용하여 다양한 뷰 간의 상관 관계를 갖는 투영을 찾는다.
- KCCA 투영 공간에서 표준 클러스터링(예: 스펙트럴 클러스터링)을 수행하여 최종 클러스터 할당을 도출한다.
- 반복적 보완 과정을 시작하기 위해 커널 행렬의 결측 항목을 기본값(예: 0 또는 평균)으로 초기화한다.
실험 결과
연구 질문
- RQ1모든 데이터셋이 불완전한 상황에서도 완전한 데이터셋이 없이 효과적으로 클러스터링을 수행할 수 있는가?
- RQ2공통 인스턴스 정렬을 통해 다수의 불완전한 데이터셋에서 커널 행렬을 얼마나 효율적으로 보완할 수 있는가?
- RQ3최소한 하나의 완전한 데이터셋이 필요로 하는 기존 방법과 비교해 공동 커널 학습이 클러스터링 성능을 향상시키는가?
- RQ4결측 데이터 비율이 증가함에 따라 CoKL의 수렴 동작은 어떻게 변화하는가?
주요 결과
- 제안된 클러스터링 알고리즘이 합성 및 실세계 데이터셋에서 기준 방법 대비 정규화 상호정보량(NMI) 기준 최대 200% 향상된다.
- 모든 실험 설정에서 CoKL은 10회 이내의 반복 수렴을 보이며 빠른 수렴을 보인다.
- 결측 비율이 높아질수록 수렴에 필요한 반복 수는 약간 증가하지만, 매우 작은 비율로 선형 증가한다.
- UCI 시드 데이터셋의 경우, 결측 비율에 관계없이 수렴이 거의 일정하게 유지되어 강건성을 보인다.
- 손글씨 네덜란드 숫자 인식 데이터셋에서는 결측 비율 증가에 따라 수렴 시간이 선형적으로 증가하지만 여전히 효율적이다.
- 신규 사용자가 프로필, 행동, 신용 데이터가 전혀 없는 실세계 상황에서도 효과적으로 처리할 수 있다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.