Skip to main content
QUICK REVIEW

[논문 리뷰] The ViP2P Platform: XML Views in P2P

Konstantinos Karanasos, Asterios Katsifodimos|arXiv (Cornell University)|2011. 12. 12.
Peer-to-Peer Network Technologies참고 문헌 36인용 수 6
한 줄 요약

ViP2P는 DHT를 사용하여 분산 XML 데이터 관리를 위한 P2P 플랫폼으로, 분산된 물리적 XML 뷰를 통해 효율적이고 확장 가능한 쿼리 처리를 가능하게 한다. 실시간 구독 기반 업데이트와 뷰 재작성에 의한 빠른 즉시 쿼리 평가를 지원하여, 대규모 WAN 배포 환경에서 이전 시스템 대비 최대 4개 주자 빠른 데이터 배포 속도를 달성한다.

ABSTRACT

The growing volumes of XML data sources on the Web or produced by enterprises, organizations etc. raise many performance challenges for data management applications. In this work, we are concerned with the distributed, peer-to-peer management of large corpora of XML documents, based on distributed hash table (or DHT, in short) overlay networks. We present ViP2P (standing for Views in Peer-to-Peer), a distributed platform for sharing XML documents based on a structured P2P network infrastructure (DHT). At the core of ViP2P stand distributed materialized XML views, defined by arbitrary XML queries, filled in with data published anywhere in the network, and exploited to efficiently answer queries issued by any network peer. ViP2P allows user queries to be evaluated over XML documents published by peers in two modes. First, a long-running subscription mode, when a query can be registered in the system and receive answers incrementally when and if published data matches the query. Second, queries can also be asked in an ad-hoc, snapshot mode, where results are required immediately and must be computed based on the results of other long-running, subscription queries. ViP2P innovates over other similar DHT-based XML sharing platforms by using a very expressive structured XML query language. This expressivity leads to a very flexible distribution of XML content in the ViP2P network, and to efficient snapshot query execution. ViP2P has been tested in real deployments of hundreds of computers. We present the platform architecture, its internal algorithms, and demonstrate its efficiency and scalability through a set of experiments. Our experimental results outgrow by orders of magnitude similar competitor systems in terms of data volumes, network size and data dissemination throughput.

연구 동기 및 목표

  • 동적인 분산 환경에서 대규모 XML 데이터 코퍼스의 확장성 있고 탈중앙화된 관리를 해결한다.
  • 중앙 집중식 조정 없이도 P2P 네트워크에 배포된 XML 데이터에 대해 효율적이고 실시간으로 쿼리 평가를 가능하게 한다.
  • 두 가지 쿼리 모드를 지원한다: 증분 결과를 위한 장기적인 구독과 사전 계산된 뷰를 이용한 즉시 쿼리 스냅샷.
  • 네트워크 크기, 데이터 볼륨, 동시에 발생하는 게시자/소비자 워크로드에 대해 효율적으로 확장 가능한 시스템을 설계한다.
  • 실제 P2P 배포 환경에서 지연 시간을 최소화하고 처리량을 극대화하기 위해 뷰 물리화 및 쿼리 재작성 최적화를 수행한다.

제안 방법

  • 구조화된 DHT 오버레이 네트워크를 활용하여 피어 간 XML 문서 및 뷰의 분산 및 위치 탐색을 수행한다.
  • 임의의 XQuery 유사 쿼리로 정의된 분산 물리적 XML 뷰를 도입하며, 일치하는 데이터가 게시될 때마다 점진적으로 채워진다.
  • 뷰 룩업 및 쿼리 재작성의 효율성을 높이기 위해 레이블 인덱싱(LI), 리턴 레이블 인덱싱(RLI), 리프 경로 인덱싱(LPI), 리턴 경로 인덱싱(RPI) 등의 다수의 뷰 인덱싱 전략을 적용한다.
  • 사용자 쿼리를 이용 가능한 물리적 뷰를 활용해 재작성하여 사전 계산된 결과를 활용함으로써 즉시 쿼리 처리를 지원한다.
  • 최대한의 배포 처리량을 확보하기 위해 비동기적이고 병렬화된 데이터 전송 및 최적화된 데이터 추출 파이프라인을 사용한다.
  • 문서 관리, 뷰 관리, 쿼리 처리 전용 모듈을 갖춘 모듈식 피어 아키텍처를 채택한다.

실험 결과

연구 질문

  • RQ1DHT 인프라를 기반으로 한 대규모 동적 P2P 네트워크에서 분산 물리적 XML 뷰를 효율적으로 유지하고 쿼리할 수 있는 방법은 무엇인가?
  • RQ2탈중앙화된 환경에서 뷰 룩업 및 쿼리 재작성의 효율성을 극대화하기 위해 어떤 인덱싱 전략이 가장 효과적인가?
  • RQ3뷰 기반 쿼리 재작성은 P2P XML 시스템에서 즉시 쿼리 평가 성능을 얼마나 향상시킬 수 있는가?
  • RQ4실제 배포 환경에서 데이터 볼륨, 네트워크 크기, 동시에 발생하는 게시자/소비자 워크로드 측면에서 시스템의 확장성은 어떻게 평가되는가?
  • RQ5뷰 물리화 및 데이터 배포 과정에서 비동기 통신과 병렬화를 통해 달성할 수 있는 성능 향상은 어느 정도인가?

주요 결과

  • ViP2P는 WAN을 통해 250개의 피어에 160GB의 XML 데이터를 15분 이내로 성공적으로 배포하여 고도의 확장성과 처리량을 입증했다.
  • 시스템은 KadoP 및 psiX와 같은 이전 DHT 기반 XML 플랫폼 대비 최대 4개 주자 빠른 데이터 배포 속도를 달성했다.
  • 게시자 및 소비자 수 증가에 따라 뷰 물리화가 효과적으로 확장되었지만, 고도의 연결성을 가진 피어에서의 경쟁으로 성능 저하가 발생했으며, 이는 대규모 시스템에서 예상되는 현상이다.
  • 데이터 관심이 하위 공동체 간에 균일하게 분포된 경우, 효과적인 병렬 처리 덕분에 데이터 전송 속도가 1,000배 향상되었다.
  • 레이블 기반 인덱싱 전략, 특히 리턴 레이블 인덱싱(RLI)이 다른 전략들에 비해 뷰 룩업 및 검색 효율성에서 뛰어난 성능을 보였다.
  • ViP2P 쿼리 실행 엔진은 데이터 볼륨에 따라 선형적으로 확장되었으며, 이는 이전 실제 DHT 배포 시스템 대비 주자 수준으로 더 많은 데이터를 처리할 수 있음을 의미한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.