Skip to main content
QUICK REVIEW

[論文レビュー] Clustering RDF Databases Using Tunable-LSH

Güneş Aluç, M. TAMER ÖZSU|arXiv (Cornell University)|Apr 10, 2015
Caching and Content Delivery参考文献 46被引用数 4
ひとこと要約

本稿では、SPARQLワークロードにおける共通アクセスパターンに基づいてRDFデータベースレコードを動的にクラスタリングする自己調整型局所性に敏感なハッシュ化(Tunable-LSH)を提案する。変化するクエリワークロードに常に適応することで、定数時間で頻繁に共通でアクセスされるレコードを同じ物理的ストレージページにマッピングし、chameleon-dbなどのRDF管理システムにおけるI/O効率およびキャッシュ利用効率を顕著に向上させる。

ABSTRACT

The Resource Description Framework (RDF) is a W3C standard for representing graph-structured data, and SPARQL is the standard query language for RDF. Recent advances in Information Extraction, Linked Data Management and the Semantic Web have led to a rapid increase in both the volume and the variety of RDF data that are publicly available. As businesses start to capitalize on RDF data, RDF data management systems are being exposed to workloads that are far more diverse and dynamic than what they were designed to handle. Consequently, there is a growing need for developing workload-adaptive and self-tuning RDF data management systems. To realize this vision, we introduce a fast and efficient method for dynamically clustering records in an RDF data management system. Specifically, we assume nothing about the workload upfront, but as SPARQL queries are executed, we keep track of records that are co-accessed by the queries in the workload and physically cluster them. To decide dynamically (hence, in constant-time) where a record needs to be placed in the storage system, we develop a new locality-sensitive hashing (LSH) scheme, Tunable-LSH. Using Tunable-LSH, records that are co-accessed across similar sets of queries can be hashed to the same or nearby physical pages in the storage system. What sets Tunable-LSH apart from existing LSH schemes is that it can auto-tune to achieve the aforementioned clustering objective with high accuracy even when the workloads change. Experimental evaluation of Tunable-LSH in our prototype RDF data management system, chameleon-db, as well as in a standalone hashtable shows significant end-to-end improvements over existing solutions.

研究の動機と目的

  • 非常に動的かつ予測不能なSPARQLワークロード下でのRDFデータベースにおける物理的データクラスタリングの課題に対処すること。
  • 従来のオフラインクラスタリングや静的物理スキーマの限界を克服し、進化するRDFワークロードに不適切である点を改善すること。
  • 事前のワークロード知識なしに、ランタイムで適応的かつ動的にRDFレコードをクラスタリングし、ランダムI/Oおよびキャッシュミスを低減すること。
  • クエリアクセスパターンの変化にかかわらず、高いクラスタリング精度を維持する定数時間の自己調整ハッシュ機構を設計すること。
  • ワークロードに配慮した物理的構成をRDFシステムに実装し、動的レコード配置によってパフォーマンスを向上させること。

提案手法

  • 各SPARQLクエリのアクセスパターンを、各ビットがレコードのアクセス有無を示すビットベクトル(クエリアクセスベクトル)として表現する。
  • 新規の局所性に敏感なハッシュ化(LSH)スキーム、Tunable-LSHを用いて、類似したアクセスパターンを持つレコードを同じまたは近接するストレージページにマッピングする。
  • 新しいクエリが実行される度に、リアルタイムでハッシュ関数を動的に更新し、ワークロードの変化に適応可能にする。
  • データベースキャッシュのアドミッションポリシーを活用して「ウォーム」レコード(頻繁にアクセスされるもの)を特定し、クラスタリング作業の焦点をそれらに当てる。
  • 類似しないレコードが同じページにマッピングされる(偽陽性)のを最小限に抑えつつ、実際に共通でアクセスされるレコードを同じページに最大限に集約するハッシュ関数を設計する。
  • chameleon-dbのストレージレイヤーにTunable-LSHを統合し、最小限のランタイムオーバーヘッドでオンラインかつ段階的なクラスタリングを可能にする。

実験結果

リサーチクエスチョン

  • RQ1事前のワークロード知識なしに、進化するSPARQLクエリワークロードに基づいてRDFデータベースが動的にレコードをクラスタリングする方法は何か?
  • RQ2クエリアクセスパターンの変化に伴っても高いクラスタリング精度を維持できる自己調整型LSHスキームを設計できるか?
  • RQ3自己調整型LSHに基づくクラスタリング機構をRDFシステムに適用した場合、I/O効率およびキャッシュ利用効率にどのような影響を与えるか?
  • RQ4Tunable-LSHは、従来の静的またはオフラインクラスタリング手法と比較して、クラスタリング品質およびランタイムでの適応性において優れているか?
  • RQ5Tunable-LSHによる動的レコード配置は、実世界のRDFワークロードにおいてエンドツーエンドのクエリパフォーマンスをどの程度向上できるか?

主な発見

  • Tunable-LSHはストレージシステムにおける定数時間のレコード配置を可能にし、動的ワークロードへのオンラインでリアルタイムな適応が可能である。
  • 頻繁に共通でアクセスされるレコードをまとめるため、ランダムI/Oおよびキャッシュスタールを顕著に低減し、キャッシュ局所性が向上する。
  • chameleon-dbおよびスタンドアロンのハッシュテーブルでの実験的評価により、既存のソリューションと比較して測定可能なエンドツーエンドのパフォーマンス向上が確認された。
  • ワークロードのシフトが生じてもTunable-LSHは高いクラスタリング精度を維持し、自己調整機能を欠いた従来のLSHスキームを上回る性能を示した。
  • より多くのクエリが実行されるにつれて、システムのパフォーマンスは着実に向上し、観察されたアクセスパターンに基づいてクラスタリング品質が時間経過とともに向上する。
  • 本手法は、物化ビューおよび適応的キャッシュなどの既存のワークロードに配慮した技術と相乗効果を発揮し、包括的な自己調整型RDFデータベースシステムの実現を可能にする。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。