Skip to main content
QUICK REVIEW

[論文レビュー] The ViP2P Platform: XML Views in P2P

Konstantinos Karanasos, Asterios Katsifodimos|arXiv (Cornell University)|Dec 12, 2011
Peer-to-Peer Network Technologies参考文献 36被引用数 6
ひとこと要約

ViP2P は、DHT を使用して分散 XML データ管理を実現する P2P プラットフォームであり、分散物化 XML ビューを通じて効率的でスケーラブルなクエリ処理を可能にする。リアルタイムのサブスクリプションベースの更新と、ビュー再書き換えによる高速なアドホッククエリ評価をサポートし、大規模な WAN デプロイにおいて、従来のシステムと比較して最大 4 時間単位の速度向上を達成した。

ABSTRACT

The growing volumes of XML data sources on the Web or produced by enterprises, organizations etc. raise many performance challenges for data management applications. In this work, we are concerned with the distributed, peer-to-peer management of large corpora of XML documents, based on distributed hash table (or DHT, in short) overlay networks. We present ViP2P (standing for Views in Peer-to-Peer), a distributed platform for sharing XML documents based on a structured P2P network infrastructure (DHT). At the core of ViP2P stand distributed materialized XML views, defined by arbitrary XML queries, filled in with data published anywhere in the network, and exploited to efficiently answer queries issued by any network peer. ViP2P allows user queries to be evaluated over XML documents published by peers in two modes. First, a long-running subscription mode, when a query can be registered in the system and receive answers incrementally when and if published data matches the query. Second, queries can also be asked in an ad-hoc, snapshot mode, where results are required immediately and must be computed based on the results of other long-running, subscription queries. ViP2P innovates over other similar DHT-based XML sharing platforms by using a very expressive structured XML query language. This expressivity leads to a very flexible distribution of XML content in the ViP2P network, and to efficient snapshot query execution. ViP2P has been tested in real deployments of hundreds of computers. We present the platform architecture, its internal algorithms, and demonstrate its efficiency and scalability through a set of experiments. Our experimental results outgrow by orders of magnitude similar competitor systems in terms of data volumes, network size and data dissemination throughput.

研究の動機と目的

  • 動的で分散型の環境における大規模 XML データコーパスのスケーラブルで分散型の管理の課題に取り組む。
  • 中央集権的な調整なしに、P2P ネットワークに配布された XML データに対して、効率的でリアルタイムのクエリ評価を可能にする。
  • 2 種類のクエリモードをサポートする:継続的な結果を得るための長時間実行のサブスクリプションと、事前に計算されたビューを使用するアドホックなスナップショットクエリ。
  • ネットワーク規模、データ量、同時に発行・消費されるワークロードの両面で、効率的にスケーリングするシステムを設計する。
  • 実際の P2P デプロイ環境において、遅延を最小限に抑え、スルーレートを最大化するため、ビュー物化とクエリ再書き換えを最適化する。

提案手法

  • 構造的な DHT オーバーレイネットワークを活用して、ピア間で XML ドキュメントとビューを分散配置・検索する。
  • 任意の XQuery に類似したクエリによって定義される分散物化 XML ビューを導入し、一致するデータが発行される度に段階的に充填する。
  • ビューの検索とクエリ再書き換えを高速化するため、複数のビューインデクシング戦略(ラベルインデクシング(LI)、リターンラベルインデクシング(RLI)、リーフパスインデクシング(LPI)、リターンパスインデクシング(RPI))を採用する。
  • 利用可能な物化ビューを活用してユーザークエリを再書き換えすることで、アドホックなクエリ処理を可能にする。
  • 非同期的かつ並列化されたデータ転送と最適化されたデータ抽出パイプラインを用いて、配布スルーレートを最大化する。
  • ドキュメント管理、ビュー管理、クエリ処理の各モジュールを専用化したモジュラーなピアアーキテクチャを採用する。

実験結果

リサーチクエスチョン

  • RQ1DHT インfraストラクチャを活用する大規模で動的な P2P ネットワークにおいて、分散物化 XML ビューを効率的に維持・照会する方法は何か?
  • RQ2分散環境において、ビューの検索とクエリ再書き換えの効率を最大化するためのインデクシング戦略は何か?
  • RQ3ビューに基づくクエリ再書き換えは、P2P XML システムにおけるアドホッククエリ評価のパフォーマンスをどの程度向上できるか?
  • RQ4実際のデプロイにおいて、データ量、ネットワーク規模、および同時に発行・消費されるワークロードの両面で、このシステムはどの程度スケーリングするか?
  • RQ5ビュー物化とデータ配布における非同期通信と並列化によって、どの程度のパフォーマンス向上が達成できるか?

主な発見

  • ViP2P は、WAN を介して 250 ピアにわたる 160GB の XML データを 15 分未満で効率的に配布し、高いスケーラビリティとスルーレートを実証した。
  • 本システムは、KadoP や psiX といった従来の DHT ベースの XML プラットフォームと比較して、データ配布速度が最大 4 時間単位の高速化を達成した。
  • ビュー物化は、発行者および消費者の数に応じて効果的にスケーリングされたが、高次数のピアでの競合が性能に悪影響を及えた。これは大規模システムにおいて想定される現象である。
  • データの関心がサブコミュニティ間で均等に分散されていた場合、効果的な並列化のおかげでデータ転送速度が 1,000 倍向上した。
  • ラベルベースのインデクシング戦略、特にリターンラベルインデクシング(RLI)が、他の戦略と比較してビュー検索と取得効率で優れていた。
  • ViP2P のクエリ実行エンジンは、データ量に比例して線形にスケーリングし、過去の実際の DHT デプロイと比較して、桁違いのデータ量を処理できるようになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。