Skip to main content
QUICK REVIEW

[논문 리뷰] An Improved Cost Function for Hierarchical Cluster Trees

Dingkang Wang, Yusu Wang|arXiv (Cornell University)|2018. 12. 06.
Advanced Clustering Algorithms Research참고 문헌 6인용 수 8
한 줄 요약

이 논문은 유사도 그래프의 내재된 계층적 구조를 더 잘 반영하는 계층적 클러스터링 트리용 새로운 비용 함수를 제안한다. Dasgupta의 원래 비용 함수와 달리, 이 새로운 함수는 그래프가 '완벽한 HC-구조'를 가진 경우에만 정확히 1의 최적 비용을 부여하여 더 명확한 해석과 다항시간 계산을 가능하게 한다.

ABSTRACT

Hierarchical clustering has been a popular method in various data analysis applications. It partitions a data set into a hierarchical collection of clusters, and can provide a global view of (cluster) structure behind data across different granularity levels. A hierarchical clustering (HC) of a data set can be naturally represented by a tree, called a HC-tree, where leaves correspond to input data and subtrees rooted at internal nodes correspond to clusters. Many hierarchical clustering algorithms used in practice are developed in a procedure manner. Dasgupta proposed to study the hierarchical clustering problem from an optimization point of view, and introduced an intuitive cost function for similarity-based hierarchical clustering with nice properties as well as natural approximation algorithms. We observe that while Dasgupta's cost function is effective at differentiating a good HC-tree from a bad one for a fixed graph, the value of this cost function does not reflect how well an input similarity graph is consistent to a hierarchical structure. In this paper, we present a new cost function, which is developed based on Dasgupta's cost function, to address this issue. The optimal tree under the new cost function remains the same as the one under Dasgupta's cost function. However, the value of our cost function is more meaningful. The new way of formulating the cost function also leads to a polynomial time algorithm to compute the optimal cluster tree when the input graph has a perfect HC-structure, or an approximation algorithm when the input graph 'almost' has a perfect HC-structure. Finally, we provide further understanding of the new cost function by studying its behavior for random graphs sampled from an edge probability matrix.

연구 동기 및 목표

  • Dasgupta의 비용 함수가 유사도 그래프가 내재적으로 계층적 구조를 지원하는지 반영하지 못하는 한계를 해결하기 위해.
  • 계층적 클러스터링 트리의 최적성에 대해 더 해석 가능하고 의미 있는 값을 할당하는 비용 함수를 개발하기 위해.
  • 새로운 비용 함수 하에서 최적 트리가 Dasgupta의 함수 하에서의 최적 트리와 동일하게 유지되어 바람직한 구조적 성질을 보존하기 위해.
  • 입력 그래프가 완벽한 계층적 구조를 가진 경우에 최적 트리를 다항시간에 계산할 수 있도록 하기 위해.
  • 주어진 간선 확률 행렬에서 생성된 무작위 그래프에 대한 비용 함수의 행동을 분석할 수 있는 이론적 프레임워크를 제공하기 위해.

제안 방법

  • 새로운 비용 함수는 Dasgupta의 원래 비용 함수의 정규화된 변형으로, 구조 일관성을 반영하도록 스케일링된다.
  • 입력 그래프가 모든 삼중관계와 일관된 계층적 클러스터링 트리가 존재하는 경우에만 최적 비용이 정확히 1이 되도록 정의된다.
  • 기본 비용 함수 baseC(G)를 도입하여, 그래프의 간선 확률 분포 하에서 무작위 트리의 기대 비용을 캡처한다.
  • 비율-비용 함수 ρ*G = totalC(T*) / baseC(G)를 정의하여, 최적 트리의 총 비용을 기대 기본 비용에 상대적으로 정규화한다.
  • 이론적 분석은 농도 부등식을 사용하여 비율-비용이 기대값에서 벗어나지 않는 범위를 제한하여 확률적 보장을 확립한다.
  • 알고리즘적 구성 요소는 새로운 비용 함수를 활용하여 완벽한 HC-구조를 가진 그래프에 대해 다항시간 알고리즘을 설계하고, 거의 완벽한 경우에 대해 근사 알고리즘을 제공한다.

실험 결과

연구 질문

  • RQ1입력 그래프가 완벽한 계층적 구조를 가진다는 것을 직접적으로 나타내는 비용 함수를 설계할 수 있는가?
  • RQ2계층적 클러스터링 품질에 대해 더 해석 가능한 척도를 제공하기 위해 비용 함수를 어떻게 정규화할 수 있는가?
  • RQ3입력 그래프가 완벽한 계층적 구조를 가진 경우에, 새로운 비용 함수를 사용해 최적의 계층적 클러스터링 트리를 다항시간에 계산할 수 있는 조건은 무엇인가?
  • RQ4주어진 간선 확률 행렬에서 샘플링된 무작위 그래프에서 새로운 비용 함수는 어떻게 행동하는가?
  • RQ5새로운 비용 함수는 거의 완벽하지만 완전히 완벽하지 않은 계층적 구조를 보이는 그래프에 대해 근사 알고리즘을 지원할 수 있는가?

주요 결과

  • 새로운 비용 함수의 최적 비용은 입력 그래프가 완벽한 계층적 클러스터링(HC) 구조를 가진 경우에만 정확히 1이 된다. 즉, 모든 삼중관계와 일관된 HC-트리가 존재하는 경우이다.
  • 완벽한 HC-구조를 가진 그래프의 경우, 새로운 비용 함수를 사용하여 최적 트리를 다항시간에 계산할 수 있다.
  • 입력 그래프가 거의 완벽한 HC-구조를 가진 경우, 이 방법은 최적 트리에 대한 근사 알고리즘을 제공한다.
  • 간선 확률 행렬에서 생성된 무작위 그래프의 경우, 비율-비용 ρ*G는 모든 간선의 확률이 p일 때 (1+o(1)) · 2 / (3p − p²)로 수렴한다.
  • 비율-비용 ρ*G는 내부 클러스터 간선 확률 p가 증가할수록 감소하며, 이는 높은 내부 유사도가 계층 신호를 강화함을 시사한다.
  • 편미분 분석 결과, p를 증가시키면 ρ*G가 감소하는 반면, q(외부 클러스터 간선 확률)는 더 복잡하고 비단조적 영향을 미치며, q = p/3에서 임계점이 존재한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.