Skip to main content
QUICK REVIEW

[論文レビュー] An Effective Approach for Web Document Classification using the Concept of Association Analysis of Data Mining

Rajendra Kumar Roul, Sanjay K. Sahay|arXiv (Cornell University)|Jun 21, 2014
Text and Document Classification Technologies参考文献 8被引用数 10
ひとこと要約

本稿では、FP-Growthアルゴリズムを用いた頻出項目集合マイニングにより関連語のパターンを抽出し、それを特徴量として用いることで、Webドキュメント分類手法を提案する。その後、ナイーブベイズ分類器を用いて分類を行う。Gensim NLPパッケージを活用することで、有効な分類性能が得られ、関連分析の有効性が示された。

ABSTRACT

Exponential growth of the web increased the importance of web document classification and data mining. To get the exact information, in the form of knowing what classes a web document belongs to, is expensive. Automatic classification of web document is of great use to search engines which provides this information at a low cost. In this paper, we propose an approach for classifying the web document using the frequent item word sets generated by the Frequent Pattern (FP) Growth which is an association analysis technique of data mining. These set of associated words act as feature set. The final classification obtained after Naïve Bayes classifier used on the feature set. For the experimental work, we use Gensim package, as it is simple and robust. Results show that our approach can be effectively classifying the web document.

研究の動機と目的

  • 急激に増加するWebの文書に対して、手作業による分類が高コストであるという課題に対処すること。
  • データマイニングの関連分析を応用し、Webドキュメント内の意味のある語のパターンを同定すること。
  • 頻出語の集合を特徴量として用いることで、自動的で低コストな分類パイプラインを構築すること。
  • FP-Growthとナイーブベイズを組み合わせた分類手法の有効性を評価すること。
  • 提案手法の実装および評価にGensimを用いることの妥当性を示すこと。

提案手法

  • FP-GrowthアルゴリズムをWebドキュメントに適用し、語の頻出アイテムセットを特定することで、テキスト内の関連パターンを抽出する。
  • これらの頻出語の集合を、各ドキュメントの主な特徴量表現として抽出する。
  • 生成された特徴量集合に対してナイーブベイズ分類器を学習・適用し、ドキュメントのクラスを割り当てる。
  • Gensim NLPパッケージは、そのシンプルさと頑丈さから、テキスト前処理、特徴抽出、分類に用いられる。
  • 本手法は、ドキュメントをトランザクション形式で表現する。各ドキュメントは、語の集合として扱われ、関連ルールマイニングの対象となる。
  • 本手法は、従来のバッグオブワーズを避けるものであり、関連分析による共起語のパターンに注目する。

実験結果

リサーチクエスチョン

  • RQ1FP-Growthによる頻出アイテムセットマイニングは、Webドキュメントから分類に適した意味のある特徴量集合を効果的に抽出できるか?
  • RQ2FP-Growthから得られる特徴量を用いた場合と従来の特徴量を用いた場合とで、ナイーブベイズ分類器の性能はどのように異なるか?
  • RQ3関連分析は、Webドキュメント分類の正確性と効率性をどの程度向上できるか?
  • RQ4Gensimパッケージは、このようなハイブリッド分類パイプラインの実装および評価に適しているか?
  • RQ5FP-Growthのようなデータマイニング技術の統合は、テキスト分類タスクにおける特徴表現を向上させることができるか?

主な発見

  • 提案手法は、FP-Growthから得られる頻出語の集合を特徴量として用いることで、Webドキュメントの分類を効果的に実行できる。
  • 関連分析を活用することで、意味的に関連する語のパターンを同定でき、分類性能の向上が達成された。
  • FP-Growthで生成された特徴量集合に対してナイーブベイズ分類器を適用することで、信頼性の高い分類結果が得られた。
  • Gensimパッケージは、分類パイプラインの実装に非常に頑丈で実用的なツールであることが実証された。
  • 本手法は、有望な結果を示す低コストで自動化されたWebドキュメント分類ソリューションである。
  • 本研究では、関連分析が、テキスト分類における従来の特徴抽出手法の価値ある代替手段であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。