Skip to main content
QUICK REVIEW

[论文解读] Discovery of Web Usage Profiles Using Various Clustering Techniques

Zahid Ansari, Waseem Ahmed|arXiv (Cornell University)|Sep 1, 2015
Recommender Systems and Techniques参考文献 24被引用 4
一句话总结

本文评估了四种聚类技术——k-Means、k-Medoids、Leader 和 DBSCAN——在从网页日志数据中发现网络使用模式方面的表现。该研究在真实导航数据上实现了这些方法并进行比较,结果表明 DBSCAN 在最小化参数调优的情况下,能够实现最高的聚类有效性与性能,准确识别用户访问模式。

ABSTRACT

The explosive growth of World Wide Web (WWW) has necessitated the development of Web personalization systems in order to understand the user preferences to dynamically serve customized content to individual users. To reveal information about user preferences from Web usage data, Web Usage Mining (WUM) techniques are extensively being applied to the Web log data. Clustering techniques are widely used in WUM to capture similar interests and trends among users accessing a Web site. Clustering aims to divide a data set into groups or clusters where inter-cluster similarities are minimized while the intra cluster similarities are maximized. This paper reviews four of the popularly used clustering techniques: k-Means, k-Medoids, Leader and DBSCAN. These techniques are implemented and tested against the Web user navigational data. Performance and validity results of each technique are presented and compared.

研究动机与目标

  • 使用聚类技术从网页日志数据中识别并提取用户访问模式。
  • 评估多种聚类算法在发现有意义的网络使用模式方面的有效性。
  • 在网页使用挖掘的背景下,比较 k-Means、k-Medoids、Leader 和 DBSCAN 在聚类性能与有效性指标上的表现。
  • 基于真实世界的网页访问数据,确定最适合个性化系统的聚类方法。

提出的方法

  • 应用 k-Means 聚类方法,基于用户导航行为使用欧几里得距离对用户进行分组。
  • 实现 k-Medoids 作为 k-Means 的稳健替代方法,通过选择实际数据点作为聚类中心。
  • 使用 Leader 算法,一种基于邻近度和密度的层次聚类方法。
  • 采用 DBSCAN,一种基于密度的聚类算法,通过核心点和可达性识别聚类,能够有效处理噪声和不同形状的聚类。
  • 使用标准聚类有效性指数(如轮廓系数和 Calinski-Harabasz 指数)评估每种方法。
  • 在真实网页日志数据上测试所有算法,以提取用户访问模式并评估聚类质量。

实验结果

研究问题

  • RQ1哪种聚类技术最能捕捉网页日志数据中的用户访问模式?
  • RQ2在网页使用数据上,k-Means、k-Medoids、Leader 和 DBSCAN 在聚类有效性与性能方面如何比较?
  • RQ3哪种算法在最小化参数调优的情况下最有效地识别出有意义的用户画像?
  • RQ4不同技术在聚类内部相似性与聚类间分离性方面的聚类结果有何差异?

主要发现

  • DBSCAN 达到了最高的轮廓系数和 Calinski-Harabasz 指数,表明其聚类质量最优。
  • k-Medoids 在稳定性与对网页日志数据中异常值的鲁棒性方面优于 k-Means。
  • Leader 算法表现中等,但对邻近距离阈值的选择较为敏感。
  • DBSCAN 有效识别了形状和大小各异的聚类,包括噪声点,因此适用于异构用户行为。
  • 所有方法均成功揭示了明显的用户访问模式,但 DBSCAN 在不同评估指标下表现出最一致的性能。
  • 本研究证实,基于聚类的网页使用挖掘对个性化系统有效,DBSCAN 作为最具可靠性的方法在用户画像发现中脱颖而出。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。