Skip to main content
QUICK REVIEW

[論文レビュー] Low Cost Page Quality Factors To Detect Web Spam

Ashish Chandra|arXiv (Cornell University)|Oct 8, 2014
Spam and Phishing Detection参考文献 13被引用数 5
ひとこと要約

本稿では、URL、コンテンツ、リンクの特徴に分類された32の低コストでリアルタイムなページ品質要因を提案し、Webスパムを検出する。レジリエントなバックプロパゲーションニューラルネットワークを用いることで、最小限のCPU使用量で高い精度を達成し、検索エンジンにおけるスケーラブルな展開を可能にし、結果の品質を維持する。

ABSTRACT

Web spam is a big challenge for quality of search engine results. It is very important for search engines to detect web spam accurately. In this paper we present 32 low cost quality factors to classify spam and ham pages on real time basis. These features can be divided in to three categories: (i) URL features, (ii) Content features, and (iii) Link features. We developed a classifier using Resilient Back-propagation learning algorithm of neural network and obtained good accuracy. This classifier can be applied to search engine results on real time because calculation of these features require very little CPU resources.

研究の動機と目的

  • 検索エンジンの結果品質を低下させるWebスパムの増加という課題に対処すること。
  • スパムとノンスパム(ハム)のWebページを分類するスケーラブルでリアルタイムなシステムを開発すること。
  • スパムと正当なページを信頼性高く区別できる、低複雑性で計算効率の良い特徴を特定すること。
  • 最小限のCPUリソース使用量により、実際の検索エンジンでの実用的展開を可能にすること。
  • 高価または複雑な分析に依存せずに、スパム検出の精度を向上させること。

提案手法

  • 著者らは、3つのカテゴリー(URL特徴、コンテンツ特徴、リンク特徴)に分類された32の低コストな品質要因を抽出する。
  • これらの特徴は、抽出に最小限のCPUリソースを要するように設計されており、計算的に軽量である。
  • レジリエントなバックプロパゲーション(RBF)ニューラルネットワークを訓練し、抽出された特徴に基づいてページをスパムまたはハムに分類する。
  • 分類器はリアルタイム性能を最適化されており、検索エンジンの結果フィルタリングに即座に適用可能である。
  • 特徴工学は、URL構造の異常、コンテンツの重複、不審なリンクパターンといったヒューリスティクスに焦点を当てる。
  • モデルは実世界のデータで評価され、低い計算オーバーヘッドで高い精度を示した。

実験結果

リサーチクエスチョン

  • RQ1低コストでリアルタイムな特徴のセットは、スパムと正当なWebページを効果的に区別できるか?
  • RQ2URL、コンテンツ、リンクベースの特徴は、スパム検出精度にどのように寄与するか?
  • RQ3これらの特徴に基づいて訓練されたニューラルネットワーク分類器は、最小限の計算コストでどの程度高い精度を達成できるか?
  • RQ4このようなシステムは、リアルタイムの検索エンジンパイプラインに実用的に展開可能か?
  • RQ5Webスパムフィルタリングにおいて、特徴の複雑さと検出性能のトレードオフは何か?

主な発見

  • 提案されたシステムは、たった32の低コストな特徴のみを用いても、リアルタイムでのスパム検出が可能で、高い分類精度を達成した。
  • レジリエントなバックプロパゲーションニューラルネットワークは、選択された特徴に基づいてスパムとハムのページを効果的に分類する学習を可能にした。
  • 特徴抽出には最小限のCPUリソースが必要であり、本手法は生産環境の検索エンジンにおける大規模展開に適している。
  • URL、コンテンツ、リンクベースの特徴の組み合わせは、スパム検出に強力な信号を提供する。
  • 本手法は実世界のデータでも優れたパフォーマンスを示し、生産環境での実用性が裏付けられた。
  • システムはスケーラブルで効率的であり、大規模な検索結果品質の維持に実用的な解決策を提供した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。