Skip to main content
QUICK REVIEW

[論文レビュー] A Fuzzy Clustering Based Approach for Mining Usage Profiles from Web Log Data

Zahid Ansari, Mohammad Fazle Azeem|arXiv (Cornell University)|Sep 1, 2015
Data Mining Algorithms and Applications参考文献 18被引用数 12
ひとこと要約

本稿では、ウェブログデータからユーザの利用プロファイルを抽出するためのファジィクラスタリングベースの手法を提案する。従来のハードクラスタリングに比べ、重複するアクセスパターンをより効果的に処理することで、ユーザセッション再構築の精度を向上させる。本手法は、ユーザセッションをファジィ集合としてモデル化することで、複雑なウェブ環境におけるユーザ行動分析を向上させ、より正確で洗練されたユーザナビゲーションパターンのプロファイル化を実現する。

ABSTRACT

The World Wide Web continues to grow at an amazing rate in both the size and complexity of Web sites and is well on its way to being the main reservoir of information and data. Due to this increase in growth and complexity of WWW, web site publishers are facing increasing difficulty in attracting and retaining users. To design popular and attractive websites publishers must understand their users needs. Therefore analyzing users behaviour is an important part of web page design. Web Usage Mining (WUM) is the application of data mining techniques to web usage log repositories in order to discover the usage patterns that can be used to analyze the users navigational behavior. WUM contains three main steps: preprocessing, knowledge extraction and results analysis. The goal of the preprocessing stage in Web usage mining is to transform the raw web log data into a set of user profiles. Each such profile captures a sequence or a set of URLs representing a user session.

研究の動機と目的

  • 大規模で複雑なウェブ環境におけるユーザナビゲーション行動を正確にモデル化する課題に対処すること。
  • ユーザセッションが単一のクラスタに硬直的に割り当てられる従来のハードクラスタリングの限界を克服すること。
  • 複数のユーザプロファイルに重複するか部分的なメンバーシップを持つURLを許容することで、ユーザプロファイル生成を改善すること。
  • より意味的に意味のあるユーザセッション表現を生成することで、ウェブ利用マイニングの前処理段階を強化すること。
  • 洗練されたユーザアクセスパターンの理解を通じて、ウェブサイトのパーソナライゼーションとユーザのリテンションを向上させること。

提案手法

  • ユーザのアクセス頻度および共起パターンに基づいて、URLをファジィc-平均クラスタリングでグループ化する。
  • 各ユーザセッションをファジィ集合としてモデル化し、URLが複数のクラスタに、異なるメンバーシップ度で属するようにする。
  • 特定のユーザプロファイルクラスタへのURLの属する度合いを定量化するためのメンバーシップ関数を用いる。
  • ファジィメンバーシップスコアを用いてアクセスシーケンスを集約することで、生のウェブログを構造化されたユーザプロファイルに変換する。
  • クラスタ中心点を反復的に最適化するため、クラス内分散を最小化し、クラス間分離度を最大化する目的関数を用いる。
  • 得られたファジィプロファイルを、ウェブ利用マイニングの知識抽出段階に統合し、より良い行動パターンの発見を実現する。

実験結果

リサーチクエスチョン

  • RQ1ウェブログデータを、現実のユーザナビゲーション行動を反映する意味のあるユーザプロファイルにどのように変換できるか?
  • RQ2ファジィクラスタリングは、従来のハードクラスタリングに比べ、ユーザセッション再構築の精度をどの程度向上させるか?
  • RQ3ウェブログにおける重複するアクセスパターンは、クリアなクラスタ割り当てよりもファジィメンバーシップを用いることでより良く捉えられるか?
  • RQ4提案手法は、その後続のウェブ利用マイニングタスクにおけるユーザプロファイルの質をどのように向上させるか?
  • RQ5ファジィクラスタリングは、発見された利用パターンの解釈可能性と実用性にどのような影響を与えるか?

主な発見

  • ファジィクラスタリング手法は、従来のハードクラスタリング手法に比べ、より正確で意味的に整合性のあるユーザプロファイルを成功裏に生成した。
  • 重複するアクセスパターンを有するユーザセッションが、URLが複数のプロファイルに異なるメンバーシップ度で属するように、より適切に表現された。
  • 本手法は、ハードクラスタリングが誤って表現する可能性のある洗練されたナビゲーションパターンを捉えることで、ユーザ行動モデルの精度を向上させた。
  • 得られたプロファイルは、共通するユーザアクセスシーケンスやナビゲーショントレンドのより効果的な同定を可能にした。
  • 特に高流量のウェブサイトにおいて、ノイズが多く複雑なウェブログデータの処理に対しても、本手法は頑健であることが示された。
  • 本研究は、ファジィクラスタリングがウェブ利用マイニングの前処理段階を強化し、ユーザ行動の後続分析をより良くするという点で有効であることを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。