Skip to main content
QUICK REVIEW

[論文レビュー] Preprocessing: A Prerequisite for Discovering Patterns in Web Usage Mining Process

C. Ramya, G. Kavitha|arXiv (Cornell University)|May 2, 2011
Data Mining Algorithms and Applications参考文献 1被引用数 7
ひとこと要約

本稿では、ウェブ利用マイニングにおける包括的な前処理手法を提案する。この手法は、統合、データクリーニング、ユーザー/セッション同定、データフォーマット化を統合し、ログサイズを削減するとともに、データ品質を向上させる。このアプローチにより、生のウェブログファイルのサイズが73–82%まで削減され、後続のパターン発見に最適化された構造的・ノイズフリーなログが得られる。

ABSTRACT

Web log data is usually diverse and voluminous. This data must be assembled into a consistent, integrated and comprehensive view, in order to be used for pattern discovery. Without properly cleaning, transforming and structuring the data prior to the analysis, one cannot expect to find meaningful patterns. As in most data mining applications, data preprocessing involves removing and filtering redundant and irrelevant data, removing noise, transforming and resolving any inconsistencies. In this paper, a complete preprocessing methodology having merging, data cleaning, user/session identification and data formatting and summarization activities to improve the quality of data by reducing the quantity of data has been proposed. To validate the efficiency of the proposed preprocessing methodology, several experiments are conducted and the results show that the proposed methodology reduces the size of Web access log files down to 73-82% of the initial size and offers richer logs that are structured for further stages of Web Usage Mining (WUM). So preprocessing of raw data in this WUM process is the central theme of this paper.

研究の動機と目的

  • 利用マイニングにおける多様で大量かつ一貫性のないウェブログデータを扱う課題に対処すること。
  • パターン発見の前段階でノイズ、重複、不整合を除去することで、データ品質を向上させること。
  • 意味のあるユーザー相互作用情報が保持されたまま、生のアクセスログの体積を削減すること。
  • 効率的かつ正確なウェブ利用マイニングを支援する体系的な前処理パイプラインの開発。
  • 実験的評価を通じて、提案手法の有効性を検証すること。

提案手法

  • 複数のログファイルを統合して包括的なデータセットを構築することで、データ収集の包括性を確保する。
  • 不要なエントリの削除、ノイズのフィルタリング、ログエントリ内の不整合の解消を目的としたデータクリーニングを実施する。
  • タイムスタンプ、IPアドレス、ユーザーエージェント文字列を分析して、関連するリクエストをグループ化することで、ユーザーおよびセッションの同定を実現する。
  • データフォーマット化と要約処理により、分析に適した構造的・正規化済みレコードに生ログを変換する。
  • ルールベースおよびヒューリスティック手法を用いて、ログエントリ内の異常を検出し、是正する。
  • 最終出力は、次なるウェブ利用マイニング段階で使用可能な、コンactで洗練された構造的データセットである。

実験結果

リサーチクエスチョン

  • RQ1ウェブログデータをどのように効果的に前処理すれば、利用マイニングのための品質向上とサイズ削減を達成できるか?
  • RQ2ウェブアクセスログにおける不整合を特定・是正するうえで、最も効果的な前処理手法は何か?
  • RQ3前処理によって、意味のあるユーザー相互作用パターンを失うことなく、生のウェブログファイルのサイズをどの程度まで削減できるか?
  • RQ4提案された前処理パイプラインは、後続の分析に向けたウェブログの構造性と利用可能性をどのように向上させるか?
  • RQ5前処理手法の効率性と有効性を評価するために使用できるメトリクスは何か?

主な発見

  • 提案された前処理手法により、生のアクセスログファイルのサイズは元のデータ量比で73–82%まで削減された。
  • クリーニングおよび構造化されたログは、ウェブ利用マイニングにおけるパターン発見に著しく適している。
  • 本手法は、冗長で関係のないデータを効果的に除去しつつ、必須のユーザーセッション情報は保持している。
  • 前処理パイプラインは、不整合の是正とログからのノイズフィルタリングにより、データ品質を向上させた。
  • 実験的検証により、後続のマイニングタスクに適した、より豊富で分析可能なログが得られることを確認した。
  • 本手法は、大規模なウェブログデータセットを処理するうえで、優れたスケーラビリティと効率性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。