Skip to main content
QUICK REVIEW

[논문 리뷰] Supervised Hierarchical Clustering with Exponential Linkage

Nishant Yadav, Ari Kobren|arXiv (Cornell University)|2019. 06. 19.
Face and Expression Recognition인용 수 8
한 줄 요약

이 논문은 감독형 계층적 군집화를 위한 공동 학습 프레임워크를 제안하며, 이는 비유사도 함수 학습을 새로운 지수 연결(ExpLink) 가족의 연결 함수와 밀접하게 결합한다. ExpLink 가족은 단일, 평균, 완전 연결 사이를 부드럽게 보간한다. 내부 루프에서 HAC를 사용하면서 ExpLink에 대해 경사 하강법을 최적화함으로써, 이 방법은 훈련-군집화 쌍 간의 불일치로 인한 최대 8포인트의 계층도 순도 향상을 달성하며, 수동으로 연결 함수를 선택할 필요 없이도 된다.

ABSTRACT

In supervised clustering, standard techniques for learning a pairwise dissimilarity function often suffer from a discrepancy between the training and clustering objectives, leading to poor cluster quality. Rectifying this discrepancy necessitates matching the procedure for training the dissimilarity function to the clustering algorithm. In this paper, we introduce a method for training the dissimilarity function in a way that is tightly coupled with hierarchical clustering, in particular single linkage. However, the appropriate clustering algorithm for a given dataset is often unknown. Thus we introduce an approach to supervised hierarchical clustering that smoothly interpolates between single, average, and complete linkage, and we give a training procedure that simultaneously learns a linkage function and a dissimilarity function. We accomplish this with a novel Exponential Linkage function that has a learnable parameter that controls the interpolation. In experiments on four datasets, our joint training procedure consistently matches or outperforms the next best training procedure/linkage function pair and gives up to 8 points improvement in dendrogram purity over discrepant pairs.

연구 동기 및 목표

  • 훈련 목표와 군집화 알고리즘 간의 불일치로 인한 감독형 계층적 군집화 성능 저하 문제를 해결하기 위해.
  • 군집화 알고리즘에 맞게 조정된 비유사도 함수와 연결 함수를 함께 학습하는 통합된 훈련 절차를 개발하기 위해.
  • 단일, 평균, 완전 연결 사이를 부드럽게 보간하는 미분 가능하고 학습 가능한 연결 가족을 도입하기 위해.
  • 훈련 중에 끝에서 끝까지 연결 함수를 학습함으로써 전문가가 사전에 연결 함수를 선택할 필요 없이도 되도록 하기 위해.
  • 실세계 데이터셋에서 훈련 목표와 군집화 목표를 일치시키면 군집화 품질이 향상됨을 경험적으로 검증하기 위해.

제안 방법

  • 비유사도 함수와 연결 함수를 함께 학습하는 데 사용되는 지수 연결(ExpLink) 가족을 도입하며, 여기서 연결 가중치는 지수적으로 스케일링된 쌍별 비유사도에 대한 소프트맥스를 통해 계산된다.
  • 비유사도 함수와 ExpLink 매개변수의 기울기를 계산하기 위해 내부 루프에서 미분 가능한 HAC 변형을 사용한다.
  • 다중 라운드의 HAC 동안 순수한 융합을 방지하는 손실 함수를 사용하여 순수한 군집 형성을 촉진한다.
  • ExpLink 초매개변수와 쌍별 비유사도 함수 매개변수에 대해 경사 하강법을 사용해 공동 최적화를 수행한다.
  • HAC 과정에서 순수한 융합에 기여하는 훈련 예제를 선택함으로써 일반화 성능을 향상시킨다.
  • 훈련 중에 계층도 순도를 추적하고 최적화하는 수정된 HAC 알고리즘을 사용한다.

실험 결과

연구 질문

  • RQ1훈련 목표를 군집화 알고리즘과 일치시키는 공동 학습 절차가 계층적 군집화 성능을 향상시킬 수 있는가?
  • RQ2단일, 평균, 완전 연결 사이를 보간하는 학습 가능한 연결 함수가 고정된 연결 선택보다 우수한가?
  • RQ3비유사도 함수와 연결 매개변수에 대해 끝에서 끝까지 최적화함으로써 수동으로 연결 함수를 선택할 필요가 없어지는가?
  • RQ4다양한 데이터셋에서 제안된 방법의 성능이 표준 전쌍 훈련 및 고정 연결 변형과 비교해 어떻게 되는가?
  • RQ5훈련 목표와 군집화 목표를 일치시키면 군집화 품질 저하를 유발하는 격리 정도가 어느 정도 감소하는가?

주요 결과

  • 제안된 공동 학습 절차는 네 개의 데이터셋에서 다음 최고의 훈련 절차/연결 함수 조합과 일관되게 동일하거나 이를 초월한다.
  • 훈련-군집화 목표 불일치에 비해 최대 8포인트 높은 계층도 순도를 달성함으로써, 목표 일치의 영향을 입증한다.
  • 지수 연결(ExpLink) 가족은 단일, 평균, 완전 연결 사이를 부드럽게 보간할 수 있으며, 최적의 연결 방식이 훈련 중에 자동으로 선택된다.
  • 단일 연결을 위한 특별히 설계된 훈련 알고리즘은 네 개의 데이터셋에서 표준 전쌍 훈련보다 성능을 크게 향상시킨다.
  • 공동 최적화 프레임워크는 특히 연결 선택에 있어 수동 하이퍼파라미터 튜닝의 필요성을 줄여 실세계 응용에 더 실용적으로 만들며,
  • 경험 결과로는 훈련 목표와 군집화 목표를 일치시키면 최적의 연결 방식을 사전에 알 수 없더라도 우수한 일반화 성능을 달성함을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.