Skip to main content
QUICK REVIEW

[論文レビュー] LocationSpark: In-memory Distributed Spatial Query Processing and Optimization

Mingjie Tang, Yongyang Yu|arXiv (Cornell University)|Jul 8, 2019
Data Management and Algorithms参考文献 23被引用数 9
ひとこと要約

LocationSpark は、空間クエリの偏りと通信オーバーヘッドに最適化された、メモリ内分散空間クエリ処理システムを提案する。空間ビットマップフィルタ(sFilter)を備えたコストベースのクエリスケジューラと、適応的ローカル計画最適化を導入し、Twitter や OpenStreetMap などの実際のデータセット上で、既存システム比最大 10 倍の性能向上を達成した。

ABSTRACT

Due to the ubiquity of spatial data applications and the large amounts of spatial data that these applications generate and process, there is a pressing need for scalable spatial query processing. In this paper, we present new techniques for spatial query processing and optimization in an in-memory and distributed setup to address scalability. More specifically, we introduce new techniques for handling query skew, which is common in practice, and optimize communication costs accordingly. We propose a distributed query scheduler that use a new cost model to optimize the cost of spatial query processing. The scheduler generates query execution plans that minimize the effect of query skew. The query scheduler employs new spatial indexing techniques based on bitmap filters to forward queries to the appropriate local nodes. Each local computation node is responsible for optimizing and selecting its best local query execution plan based on the indexes and the nature of the spatial queries in that node. All the proposed spatial query processing and optimization techniques are prototyped inside Spark, a distributed memory-based computation system. The experimental study is based on real datasets and demonstrates that distributed spatial query processing can be enhanced by up to an order of magnitude over existing in-memory and distributed spatial systems.

研究の動機と目的

  • データの偏りと高い I/O コストによる分散空間クエリ処理におけるスケーラビリティとパフォーマンスのボトル neck を解消すること。
  • 冗長なデータシャッフルを最小限に抑えることで、分散空間ジョインにおける通信オーバーヘッドを低減すること。
  • 空間クエリの偏りとデータ分布を考慮した新しいコストモデルを用いて、クエリ実行計画を最適化すること。
  • Spark を基盤実行エンジンとして用い、大規模空間ワークロードの効率的メモリ内処理を可能にすること。
  • 適応的ローカル計画選択と空間インデキシングを活用し、空間範囲および k-NN ジョインのパフォーマンスを向上させること。

提案手法

  • 空間クエリの偏りの影響を最小限に抑える実行計画を生成する新しいコストモデルを用いた分散クエリスケジューラの設計。
  • 空間分布に基づき関連するローカルノードにクエリを効率的に転送するための空間ビットマップフィルタ技術 sFilter の導入。
  • ローカルインデックスとクエリ特性を活用した、ノードごとの適応的ローカルクエリ最適化の実装。
  • Spark にシステムを統合し、そのメモリ内計算および障害耐性の能力を活用すること。
  • シャッフルコストを低減するため、データ転送前に関連するパーティションを事前に選択するビットマップベースのフィルタリングの使用。
  • EC2 クラスタ上での異なるワーカー数とジョインタイプを想定し、実データセット(Twitter, OSMP)を用いてパフォーマンスを評価すること。

実験結果

リサーチクエスチョン

  • RQ1分散空間処理における空間クエリの偏りは、どのように効果的に緩和できるか?
  • RQ2空間データの偏り下で最適なクエリ実行計画を生成するためのコストモデルは何か?
  • RQ3メモリ内計算と最適化されたフィルタリングは、空間ジョインにおける通信オーバーヘッドをどの程度低減できるか?
  • RQ4分散環境におけるワーカー数の増加に伴い、提案されたシステムはどの程度スケーリングするか?
  • RQ5既存のメモリ内空間システム(GeoSpark や Simba)と比較して、どの程度のパフォーマンス向上が達成可能か?

主な発見

  • LocationSpark は、実データセット上で既存のメモリ内および分散空間システム比最大 10 倍のパフォーマンス向上を達成した。
  • sFilter 技術により、ベースライン手法と比較してシャッフルコストが最大 180 倍まで低減され、通信オーバーヘッドが顕著に低下した。
  • ワーカー数の増加に伴い、Twitter データセットにおいて 4 から 10 ワーカーにかけて一貫した性能向上を示した。
  • 特に偏りのあるワークロード下で、空間範囲ジョイン処理において GeoSpark や SpatialSpark を上回った。
  • LocationSpark のスケジューラと sFilter を統合した Simba(opt) は顕著なパフォーマンス向上を示し、提案手法の有効性を裏付けた。
  • 提案されたコストモデルとクエリスケジューラは、都市部のラッシュアワーのような高負荷環境においても、クエリの偏りの影響を効果的に軽減した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。