Skip to main content
QUICK REVIEW

[論文レビュー] Architecture of A Scalable Dynamic Parallel WebCrawler with High Speed Downloadable Capability for a Web Search Engine

Debajyoti Mukhopadhyay, Sajal Mukherjee|arXiv (Cornell University)|Feb 3, 2011
Web Data Mining and Analysis参考文献 9被引用数 12
ひとこと要約

本稿では、複数のクローラーが重複ダウンロードを回避しながら分散型のドメイン固有環境で動作できるスケーラブルな動的並列ウェブクローラー・アーキテクチャ「WEB-SAILOR」を提案する。クライアント・サーバー型モデルを採用し、知的な負荷分散と衝突回避を実現することで、通信オーバーヘッドを最小限に抑えつつ高速なクローリングを実現し、大規模なウェブインデクシングにおけるダウンロード効率とスケーラビリティを顕著に向上させる。

ABSTRACT

Today World Wide Web (WWW) has become a huge ocean of information and it is growing in size everyday. Downloading even a fraction of this mammoth data is like sailing through a huge ocean and it is a challenging task indeed. In order to download a large portion of data from WWW, it has become absolutely essential to make the crawling process parallel. In this paper we offer the architecture of a dynamic parallel Web crawler, christened as "WEB-SAILOR," which presents a scalable approach based on Client-Server model to speed up the download process on behalf of a Web Search Engine in a distributed Domain-set specific environment. WEB-SAILOR removes the possibility of overlapping of downloaded documents by multiple crawlers without even incurring the cost of communication overhead among several parallel "client" crawling processes.

研究の動機と目的

  • 急速に拡大するワールドワイドウェブを大規模に効率的にクローリングする課題に対処すること。
  • 従来の逐次クローリングの制限を克服し、複数のクライントを介した並列データ収集を可能にすること。
  • クライント間の高い通信コストを負担せずに、並列クローラー間での重複ダウンロードを排除すること。
  • 大規模検索エンジンにおけるドメイン固有のウェブインデクシングに適したスケーラブルで分散型のアーキテクチャを設計すること。
  • 動的負荷分散と知的なリクエストルーティングにより、ダウンロード速度とシステム効率を最適化すること。

提案手法

  • 中央サーバーが複数のクライントクローラーにクローリングタスクを管理・配布するクライアント・サーバー型モデルを提案する。
  • 現在のワークロードとドメイン固有の優先順位に基づいて、URLをクライント間で動的負荷分散するメカニズムを採用する。
  • ドメインまたはサブドメインに基づいてURLを特定のクライントに割り当てる分散ハッシュテーブル(DHT)に類似したメカニズムを用いることで、クライント間の重複を最小限に抑える。
  • クライント間でのURL所有権とステータスを追跡することで、重複ダウンロードを防止するための衝突検出モジュールを実装する。
  • 並列I/O操作と最適化されたネットワークリクエスト処理を統合することで、高速ダウンロードを実現する。
  • クライントとサーバー間の非同期通信を可能にすることで、アイドル時間を削減し、全体のスループットを向上させる。

実験結果

リサーチクエスチョン

  • RQ1複数の分散クライントにまたがる効率的なスケーリングを実現しつつ、重複ダウンロードを最小限に抑えるウェブクローラーはどのようにアーキテクチャ化できるか?
  • RQ2高い調整オーバーヘッドを負担せずに、クライント間でクローリング負荷を動的に分散するにはどのようなメカニズムが有効か?
  • RQ3クライント・サーバー型アーキテクチャは、非常に動的で並列性の高い環境下でも、2つのクローラーが同じドキュメントをダウンロードしないようにどのように保証できるか?
  • RQ4従来の逐次クローリングと比較して、動的並列処理を用いることで、ダウンロード速度とシステムスループットにどの程度の向上が達成できるか?
  • RQ5ドメイン固有のクローリング戦略は、大規模なウェブインデクシングにおけるスケーラビリティ向上とリソース競合の低減に、どの程度寄与するか?

主な発見

  • WEB-SAILORアーキテクチャは、クライント間の継続的通信を要せず、並列クローラー間での重複ダウンロードを効果的に排除した。
  • リアルタイムでの利用可能状態とドメイン固有の優先順位に基づく動的負荷分散により、システムは高いダウンロードスループットを達成した。
  • ドメインベースのURL割り当て戦略の採用により、クライント間の調整ニーズが顕著に低下し、通信オーバーヘッドが低減した。
  • 本アーキテクチャは分散環境でもスケーラビリティを示し、多数の並列クローリングプロセスをサポートした。
  • URL取得の高効率性と低レイテンシが維持され、ウェブ検索エンジンのインデクシングサイクルが高速化された。
  • プロトタイプの実測結果から、従来の並列クローリングモデルと比較して、ダウンロード速度とシステム利用率に顕著な改善が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。