Skip to main content
QUICK REVIEW

[논문 리뷰] Discovery of Web Usage Profiles Using Various Clustering Techniques

Zahid Ansari, Waseem Ahmed|arXiv (Cornell University)|2015. 09. 01.
Recommender Systems and Techniques참고 문헌 24인용 수 4
한 줄 요약

이 논문은 웹 로그 데이터에서 웹 사용 패턴을 발견하기 위해 k-Means, k-Medoids, Leader, DBSCAN 네 가지 클러스터링 기법을 평가한다. 실제 탐색 데이터에 대해 이 기법들을 구현하고 비교함으로써, DBSCAN이 최소한의 파rameter 조정으로도 사용자 액세스 패턴을 식별하는 데 있어 가장 높은 클러스터링 유효성과 성능을 보임을 입증한다.

ABSTRACT

The explosive growth of World Wide Web (WWW) has necessitated the development of Web personalization systems in order to understand the user preferences to dynamically serve customized content to individual users. To reveal information about user preferences from Web usage data, Web Usage Mining (WUM) techniques are extensively being applied to the Web log data. Clustering techniques are widely used in WUM to capture similar interests and trends among users accessing a Web site. Clustering aims to divide a data set into groups or clusters where inter-cluster similarities are minimized while the intra cluster similarities are maximized. This paper reviews four of the popularly used clustering techniques: k-Means, k-Medoids, Leader and DBSCAN. These techniques are implemented and tested against the Web user navigational data. Performance and validity results of each technique are presented and compared.

연구 동기 및 목표

  • 클러스터링 기법을 사용하여 웹 로그 데이터에서 사용자 액세스 패턴을 식별하고 추출한다.
  • 다양한 클러스터링 알고리즘의 효과성을 평가하여 의미 있는 웹 사용 프로파일을 발견하는 데 기여한다.
  • 웹 사용 마이닝의 맥락에서 k-Means, k-Medoids, Leader, DBSCAN 간의 성능 및 유효성 지표를 비교한다.
  • 실제 웹 액세스 데이터 기반 개인화 시스템에 가장 적합한 클러스터링 방법을 규명한다.

제안 방법

  • 유클리드 거리 기반으로 사용자 탐색 행동을 바탕으로 k-Means 클러스터링을 적용한다.
  • 실제 데이터 포인트를 클러스터 중심으로 선택함으로써 k-Means의 대안으로 안정적인 k-Medoids를 구현한다.
  • 근접성과 밀도를 기반으로 클러스터를 형성하는 계층적 클러스터링 방법인 리더 알고리즘을 사용한다.
  • 핵심 포인트와 도달 가능성에 기반해 클러스터를 식별하는 밀도 기반 클러스터링 알고리즘인 DBSCAN을 적용한다. 노이즈 처리 및 다양한 클러스터 형상에 대응할 수 있다.
  • 실루엣 점수와 칼린스키-하라바스 지수와 같은 표준 클러스터링 유효성 지수를 사용해 각 방법을 평가한다.
  • 모든 알고리즘을 실제 웹 로그 데이터에 적용하여 사용자 액세스 패턴을 추출하고 클러스터링 품질을 평가한다.

실험 결과

연구 질문

  • RQ1어느 클러스터링 기법이 웹 로그 데이터에서 사용자 액세스 패턴을 가장 잘 포착하는가?
  • RQ2k-Means, k-Medoids, Leader, DBSCAN 간의 웹 사용 데이터에서의 클러스터링 유효성과 성능은 어떻게 비교되는가?
  • RQ3최소한의 파rameter 조정으로 가장 효과적으로 의미 있는 사용자 프로파일을 식별하는 알고리즘은 무엇인가?
  • RQ4다양한 기법 간의 클러스터 내 유사성과 클러스터 간 분리도는 어떻게 달라지나?

주요 결과

  • DBSCAN은 가장 높은 실루엣 점수와 칼린스키-하라바스 지수를 기록하여 뛰어난 클러스터링 품질을 보였다.
  • k-Medoids는 웹 로그 데이터에서 외곽치에 대한 안정성과 강건성 면에서 k-Means를 능가했다.
  • 리더 알고리즘은 중간 수준의 성능를 보였지만, 근접성 임계값의 선택에 민감했다.
  • DBSCAN은 다양한 크기와 형상의 클러스터를 효과적으로 식별했으며, 노이즈 포인트까지 처리해 이질적인 사용자 행동에 적합했다.
  • 모든 방법이 명확한 사용자 액세스 패턴을 드러내었지만, DBSCAN은 다양한 평가 지표에서 가장 일관된 성능를 보였다.
  • 본 연구는 클러스터링 기반의 웹 사용 마이닝이 개인화에 효과적임을 확인했으며, DBSCAN이 프로파일 발견에 가장 신뢰할 수 있는 방법으로 떠올랐다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.