[논문 리뷰] Evolutionary Biclustering of Clickstream Data
이 논문은 K-means, 그레디 계획법, 유전 알고리즘을 융합한 진화적 이분군집화 방법을 제안하여 클릭스트림 데이터에서 일관된 브라우징 패턴을 탐지한다. MSNBC 데이터셋에서 평가한 결과, 상호 겹침이 있는 고품질의 사용자 및 웹 페이지 이분군집을 효과적으로 식별하며, 웹 사용량 마이닝 응용 분야에서 뛰어난 성능을 보여준다.
Biclustering is a two way clustering approach involving simultaneous clustering along two dimensions of the data matrix. Finding biclusters of web objects (i.e. web users and web pages) is an emerging topic in the context of web usage mining. It overcomes the problem associated with traditional clustering methods by allowing automatic discovery of browsing pattern based on a subset of attributes. A coherent bicluster of clickstream data is a local browsing pattern such that users in bicluster exhibit correlated browsing pattern through a subset of pages of a web site. This paper proposed a new application of biclustering to web data using a combination of heuristics and meta-heuristics such as K-means, Greedy Search Procedure and Genetic Algorithms to identify the coherent browsing pattern. Experiment is conducted on the benchmark clickstream msnbc dataset from UCI repository. Results demonstrate the efficiency and beneficial outcome of the proposed method by correlating the users and pages of a web site in high degree.This approach shows excellent performance at finding high degree of overlapped coherent biclusters from web data.
연구 동기 및 목표
- 웹 사용량 마이닝에서 기존 군집화 기법의 한계를 보완하기 위해 사용자와 웹 페이지를 동시에 군집화할 수 있도록 하는 것.
- 이분군집화를 통해 클릭스트림 데이터에서 일관되고 국소적인 브라우징 패턴을 식별하는 것.
- 웹 내비게이션 행동에서 겹침이 있는 의미 있는 사용자-페이지 관계를 향상된 방식으로 탐지하는 것.
- 편익 기반 및 메타휴리스틱 기법을 통합하여 이분군집 품질과 효율성을 향상시키는 것.
- 기준 데이터셋인 클릭스트림 데이터셋을 대상으로 방법을 평가하여 그 효과성을 검증하는 것.
제안 방법
- 이 방법은 K-means를 이용한 초도 군집화, 이분군집 품질을 향상시키기 위한 그레디 계획법 절차, 그리고 글로벌 최적화를 위한 유전 알고리즘을 융합한 하이브리드 접근 방식을 사용한다.
- 이분군집은 특정 사용자 및 페이지 집합이 상관된 브라우징 행동을 보일 때 정의되며, 선택된 페이지들 사이에서 사용자 액세스 패턴의 분산이 낮을수록 일관성으로 측정된다.
- 유전 알고리즘은 적합도 함수에 따라 선택, 교차, 변이 연산을 통해 잠재적 이분군집 솔루션을 진화시킨다. 이 적합도 함수는 일관성과 커버리지의 강조를 목표로 한다.
- 이 알고리즘은 사용자 및 페이지의 겹침이 있는 부분집합을 탐색함으로써 반복적으로 이분군집 품질을 향상시키며, 다수의 겹침이 가능한 이분군집을 허용한다.
- 이 방법은 UCI 저장소에서 제공하는 MSNBC 클릭스트림 데이터셋에 적용되며, 입력 행렬 값으로 액세스 빈도를 사용한다.
- 적합도 평가에서는 이분군집 내부의 균일성과 이분군집 간의 구별성 측정치를 결합하여 진화적 탐색을 이끌어낸다.
실험 결과
연구 질문
- RQ1하이브리드 진화적 접근 방식이 클릭스트림 데이터에서 일관되고 겹침이 있는 이분군집을 효과적으로 식별할 수 있는가?
- RQ2K-means, 그레디 계획법, 유전 알고리즘의 통합이 개별 기법 대비 이분군집 품질을 어떻게 향상시키는가?
- RQ3제안된 방법은 실제 클릭스트림 데이터에서 의미 있고 국소적인 브라우징 패턴을 어느 정도 밝혀낼 수 있는가?
- RQ4이 방법은 웹 내비게이션에서 겹침이 있는 사용자-페이지 관계를 탐지하는 데 얼마나 효과적인가?
- RQ5적합도 함수 설계가 고품질 이분군집 탐지에 어떤 영향을 미치는가?
주요 결과
- 제안된 방법은 MSNBC 클릭스트림 데이터셋에서 다수의 겹침이 있는 일관된 이분군집을 성공적으로 식별하여 다양한 내비게이션 행동을 반영한다.
- K-means, 그레디 계획법, 유전 알고리즘의 통합은 개별 기법 대비 더 높은 품질의 이분군집을 도출한다.
- 이 방법은 사용자 액세스 행동이 선택된 웹 페이지 간에 높은 일관성을 보이며 국소적 브라우징 패턴을 효과적으로 포착함을 보여준다.
- 결과적으로 진화적 접근은 탐색 공간에서 탐색과 이용의 균형을 효과적으로 유지하며 안정적이고 의미 있는 이분군집을 생성한다.
- 이 방법은 대규모 클릭스트림 데이터에서도 조기에 수렴하고 강건성을 확보하여 패턴을 탐지하는 데 성공한다.
- 적합도 함수 설계가 분산이 낮고 내부 일관성이 높은 이분군집 탐지에 크게 기여한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.