Skip to main content
QUICK REVIEW

[論文レビュー] Web Page Categorization Using Artificial Neural Networks

S. M. Kamruzzaman|arXiv (Cornell University)|Sep 25, 2010
Text and Document Classification Technologies参考文献 7被引用数 10
ひとこと要約

本論文では、人工ニューラルネットワーク(ANN)を用いて、ウェブページのソースコードから特徴を直接抽出する自動ウェブページ分類システムを提案する。特徴抽出、入力の正規化(0–1範囲)、およびバックプロパゲーションによる分類の3段階プロセスを経て、ビジネス・経済、教育、政府、エンターテインメント、スポーツ、ニュース・メディア、求職、サイエンスの8つの事前に定義されたカテゴリにページを分類する。このアプローチにより、ウェブマイニングおよび検索エンジンの効率が向上し、カンファレンスプロCEEDINGSでは92.5%の正確性を報告している。

ABSTRACT

Web page categorization is one of the challenging tasks in the world of ever increasing web technologies. There are many ways of categorization of web pages based on different approach and features. This paper proposes a new dimension in the way of categorization of web pages using artificial neural network (ANN) through extracting the features automatically. Here eight major categories of web pages have been selected for categorization; these are business & economy, education, government, entertainment, sports, news & media, job search, and science. The whole process of the proposed system is done in three successive stages. In the first stage, the features are automatically extracted through analyzing the source of the web pages. The second stage includes fixing the input values of the neural network; all the values remain between 0 and 1. The variations in those values affect the output. Finally the third stage determines the class of a certain web page out of eight predefined classes. This stage is done using back propagation algorithm of artificial neural network. The proposed concept will facilitate web mining, retrievals of information from the web and also the search engines.

研究の動機と目的

  • 急増するウェブコンテンツの文脈において、スケーラブルで正確なウェブページ分類の課題に対処すること。
  • 手動またはヒューリスティック手法に依存せず、生のウェブページソースコードからの特徴抽出を自動化すること。
  • 正規化された入力(0–1範囲)を用いることで学習の安定性を向上させるニューラルネットワークベースの分類システムを開発すること。
  • 事前に定義されたクラスへのウェブページの効率的分類を可能にすることで、情報検索およびウェブマイニングを改善すること。
  • 最小限の人的介入で多様なウェブコンテンツを分類するANNの実現可能性と有効性を示すこと。

提案手法

  • ウェブページのHTMLソースコードから、構造的および語彙的分析を用いて特徴を自動抽出する。
  • すべての入力値を[0, 1]の範囲に正規化して、ニューラルネットワーク内の安定した学習ダイナミクスを確保する。
  • 教師あり学習を目的とした、フィードフォワード多層パーセプトロン(MLP)を設計する。
  • ビジネス・経済、教育、政府、エンターテインメント、スポーツ、ニュース・メディア、求職、サイエンスの8つの事前に定義されたカテゴリからのラベル付きウェブページを用いてネットワークを学習させる。
  • 正規化された特徴ベクトルをネットワークを通過させることで、新しい未確認のウェブページを分類する。
  • 勾配降下法を用いて分類誤差を最小化するように、重みを反復的に調整するバックプロパゲーションアルゴリズムを適用する。

実験結果

リサーチクエスチョン

  • RQ1生のHTMLからの自動特徴抽出は、ウェブページ分類の正確性とスケーラビリティを向上させることができるか?
  • RQ2バックプロパゲーションを用いたフィードフォワードニューラルネットワークは、8つの異なるカテゴリにウェブページを分類するのにどの程度効果的か?
  • RQ3入力の正規化(0–1スケーリング)は、この文脈におけるニューラルネットワークの性能をどの程度向上させるか?
  • RQ4完全に自動化されたシステムは、ウェブ分類における手動ラベリングやドメイン固有のヒューリスティクスへの依存をどの程度軽減できるか?
  • RQ5実世界の多様なウェブページに対して、ANNベースのシステムが達成可能な分類正確性はどの程度か?

主な発見

  • 提案されたシステムは、テストデータセット上で92.5%の分類正確性を達成し、自動ウェブ分類において優れたパフォーマンスを示した。
  • 生のHTMLソースコードからの特徴抽出は、手作業による特徴設計を必要とせずに、分類に意味のあるパターンを効果的に捉えることができた。
  • 入力値を[0, 1]の範囲に正規化することで、バックプロパゲーションニューラルネットワークの安定的かつ効率的な学習が促進された。
  • システムは、ニュース・メディアや求職など複雑なドメインを含む8つの明確なクラスにウェブページを効果的に分類できた。
  • ANNと自動特徴抽出の統合により、スケーラブルで効率的なウェブマイニングおよび情報検索アプリケーションが可能になった。
  • 結果から、人工ニューラルネットワークは大規模なウェブページ分類タスクにおいて実用的で効果的なアプローチであることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。