Skip to main content
QUICK REVIEW

[논문 리뷰] Web Search Result Clustering based on Heuristic Search and k-means

Mansaf Alam, Kishwar Sadaf|arXiv (Cornell University)|2015. 08. 11.
Data Management and Algorithms참고 문헌 24인용 수 4
한 줄 요약

이 논문은 코사인 유사도를 사용하여 최적의 클러스터 수(k)를 자동으로 결정하는 히ュ리스틱 검색과 k-means를 조합한 하이브리드 웹 검색 결과 클러스터링 방법을 제안한다. 도메인 특화 히ュ리스틱을 통해 초기 중심점을 유도함으로써 수동적인 k 지정이 필요 없고, 동일 크기의 클러스터 편향도 피할 수 있어, 사용자 정보 필요에 더 잘 부합하는 더 의미 있는, 크기가 다른 클러스터를 생성한다.

ABSTRACT

Giving user a simple and well organized web search result has been a topic of active information Retrieval (IR) research. Irrespective of how small or ambiguous a query is, a user always wants the desired result on the first display of an IR system. Clustering of an IR system result can render a way, which fulfills the actual information need of a user. In this paper, an approach to cluster an IR system result is presented.The approach is a combination of heuristics and k-means technique using cosine similarity. Our heuristic approach detects the initial value of k for creating initial centroids. This eliminates the problem of external specification of the value k, which may lead to unwanted result if wrongly specified. The centroids created in this way are more specific and meaningful in the context of web search result. Another advantage of the proposed method is the removal of the objective means function of k-means which makes cluster sizes same. The end result of the proposed approach consists of different clusters of documents having different sizes.

연구 동기 및 목표

  • 웹 검색 결과 클러스터링에서 최적의 클러스터 수(k)를 결정하는 데 도전하는 것.
  • 검색 결과를 의미적으로 유의미하고 맥락적으로 관련 있는 클러스터로 정리함으로써 사용자 불만을 줄이는 것.
  • k-means의 목적 함수가 동일 크기의 클러스터를 강제로 만드는 데 기인한 편향을 제거하는 것.
  • 더 구체적이고 의미 있는 초기 중심점을 생성하기 위해 히ュ리스틱을 사용함으로써 클러스터링 품질을 향상시키는 것.
  • 외부적인 k 지정 없이도 다양한 웹 검색 결과를 스케일러블하고 자동으로 정리할 수 있는 솔루션을 제공하는 것.

제안 방법

  • 방법은 문서 분포와 쿼리 특성에서 유도된 히ュ리스틱 기반 접근을 사용하여 k의 초기 값을 탐지한다.
  • 무작위 초기화가 아니라 도메인 특화 히ュ리스틱을 사용하여 초기 중심점을 생성함으로써 관련성과 수렴성을 향상시킨다.
  • 벡터 공간 모델에서 문서 유사도를 측정하기 위해 코사인 유사도를 거리 측정 기준으로 사용한다.
  • 히ュ리스틱에서 유도된 중심점을 사용하여 k-means 알고리즘을 적용하여 문서를 클러스터로 그룹화한다.
  • k-means의 목적 함수를 수정하여 클러스터 크기를 가변적으로 만들며, 인위적인 균일성을 피한다.
  • 최종 클러스터링 결과는 의미적으로 일관되고 균일하지 않은 크기의 클러스터로 구성되며, 실제 사용자 정보 필요에 부합한다.

실험 결과

연구 질문

  • RQ1웹 검색 결과 클러스터링에서 수동 입력 없이 최적의 클러스터 수(k)를 자동으로 결정할 수 있는가?
  • RQ2히ュ리스틱 기반 중심점 초기화가 검색 결과 클러스터의 품질과 관련성에 향상 효과를 줄 수 있는가?
  • RQ3k-means의 동일 크기 제약 조건을 제거하면 웹 검색 결과의 더 의미 있는 클러스터 구조가 도출되는가?
  • RQ4표준 k-means에 비해 히ュ리스틱과 k-means를 조합함으로써 클러스터링 효과성이 얼마나 향상되는가?
  • RQ5제안된 방법이 다양한 검색 결과에서 관련 정보를 찾는 데 사용자 노력 감소에 기여하는가?

주요 결과

  • 히ュ리스틱 접근은 외부 입력이 필요 없이 최적의 k 값을 성공적으로 결정하여 강건성을 향상시켰다.
  • 히ュ리스틱을 통해 생성된 중심점은 무작위 초기화된 중심점보다 더 구체적이고 맥락적으로 관련성이 높았다.
  • 이 방법은 다양한 크기의 클러스터를 생성하여 인위적인 균일성을 피하고 자연스러운 문서 그룹화를 반영했다.
  • 표준 k-means 목적 함수를 피했기 때문에 인위적인 클러스터링 편향을 방지할 수 있었다.
  • 결과적으로 더 의미적으로 일관되고 사용자 정보 필요에 더 잘 부합하는 클러스터를 생성했다.
  • 관련성 향상과 사용자 검색 노력 감소를 통해 클러스터링 품질이 향상됨을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.