Skip to main content
QUICK REVIEW

[論文レビュー] Compressed Vertical Partitioning for Full-In-Memory RDF Management

Sandra Álvarez-García, Nieves R. Brisaboa|arXiv (Cornell University)|Oct 18, 2013
Semantic Web and Ontologies参考文献 39被引用数 4
ひとこと要約

本稿では、主語・目的語のペairを述語ごとに垂直分割し、k²ツリーを用いて効率的に圧縮する、完全メモリ内RDF管理のための圧縮された垂直分割技術k²-triplesを提案する。各述語ごとに、1ビットが三元組 (主語, 述語, 宛先) の存在を示すスパースなバイナリ行列として表現される。この手法により、最高で10倍のメモリ圧縮が達成され、最先端のベースラインと比較してSPARQL解釈が5〜7桁速度向上する。最適化されたジョインアルゴリズムは、代表的なクエリパターンにおいて既存システムを上回る性能を発揮する。

ABSTRACT

The Web of Data has been gaining momentum and this leads to increasingly publish more semi-structured datasets following the RDF model, based on atomic triple units of subject, predicate, and object. Although it is a simple model, compression methods become necessary because datasets are increasingly larger and various scalability issues arise around their organization and storage. This requirement is more restrictive in RDF stores because efficient SPARQL resolution on the compressed RDF datasets is also required. This article introduces a novel RDF indexing technique (called k2-triples) supporting efficient SPARQL resolution in compressed space. k2-triples, uses the predicate to vertically partition the dataset into disjoint subsets of pairs (subject, object), one per predicate. These subsets are represented as binary matrices in which 1-bits mean that the corresponding triple exists in the dataset. This model results in very sparse matrices, which are efficiently compressed using k2-trees. We enhance this model with two compact indexes listing the predicates related to each different subject and object, in order to address the specific weaknesses of vertically partitioned representations. The resulting technique not only achieves by far the most compressed representations, but also the best overall performance for RDF retrieval in our experiments. Our approach uses up to 10 times less space than a state of the art baseline, and outperforms its performance by several order of magnitude on the most basic query patterns. In addition, we optimize traditional join algorithms on k2-triples and define a novel one leveraging its specific features. Our experimental results show that our technique overcomes traditional vertical partitioning for join resolution, reporting the best numbers for joins in which the non-joined nodes are provided, and being competitive in the majority of the cases.

研究の動機と目的

  • 大規模なRDFデータセットのスケーラビリティ課題に、メモリ使用量を最小限に抑えることで対処する。
  • 従来の垂直分割手法の限界と、メインメモリ上でのSPARQL性能ボトルネックを、高度な圧縮とインデキシングによって克服する。
  • 高速な三元組パターンおよびジョインクエリをサポートする、コンactで効率的かつスケーラブルなRDFストレージモデルを設計する。
  • k²ツリーによる圧縮と、主語および宛先用の補助的でコンパクトなインデックスを組み合わせることで、メインメモリ上での完全なSPARQL解釈を実現する。
  • k²-triplesデータ構造に特化した最適化されたジョインアルゴリズムを開発し、実世界のRDFワークロードにおける性能向上を図る。

提案手法

  • RDFデータセットを述語ごとに垂直分割し、各述語に対して独立した主語×宛先バイナリ行列を生成する。
  • 各行列をスパースなバイナリ構造として表現し、1ビットが三元組 (主語, 述語, 宛先) の存在を示す。
  • 各スパース行列をk²ツリーを用いて圧縮し、スパースなバイナリデータの効率的圧縮とインデックスアクセスを実現する。
  • 主語ごとの述語リストと宛先ごとの述語リストを示す2つの追加的でコンパクトなインデックスを導入し、述語が未束縛のクエリに対処する。
  • 従来のジョインアルゴリズムを最適化し、k²-triplesの構造を活かした新しいチェーンベースの評価戦略を導入する。
  • 実世界のRDFデータセットを用いてシステムを実装・評価し、RDF3X や MonetDB といった最先端システムと比較して、性能とメモリ使用量を評価する。

実験結果

リサーチクエスチョン

  • RQ1垂直分割とk²ツリー圧縮を組み合わせることで、既存のメインメモリ上RDFシステムと比較して、顕著なメモリ効率向上とクエリ性能向上が達成可能か?
  • RQ2主語および宛先用の補助的でコンパクトなインデックスの導入が、述語が未束縛のSPARQLクエリの性能にどのように影響するか?
  • RQ3三元組パターンおよびジョインクエリの実行時間とメモリフットプリントという観点から、k²-triplesモデルは既存システムをどの程度上回るか?
  • RQ4k²-triplesの構造的特徴を活かした、ジョイン解釈性能を向上させる新しいジョイン評価戦略を設計可能か?
  • RQ5中間結果セットのサイズが変動する場合を含め、異なるRDFデータセットサイズおよびジョインパターンにおいて、システムのスケーラビリティはどの程度か?

主な発見

  • k²-triplesは、最高で10倍のメモリ使用量削減を、最先端のベースラインと比較して達成し、顕著なメモリ効率向上を実現した。
  • 基本的な三元組パターンクエリにおいて、ベースラインと比較して最大で5〜7桁のSPARQL解釈速度向上を達成した。特に述語が固定されている場合に顕著であった。
  • 非結合ノードが与えられるジョインクエリ(例:A、D、Gのジョイン)において、k²-triples + はRDF3X や MonetDB を上回り、特にOOジョインではチェーン評価が最適であった。
  • 述語が未束縛の場合でも、補助インデックスのおかげでk²-triplesは競争力を持ち続けたが、固定述語のケースに比べて性能がわずかに低下した。
  • k²-triples + における新規のチェーンベースのジョイン評価戦略は、OOジョインにおいて最良の性能を発揮し、ほとんどのケースでRDF3X やインタラクティブ評価を上回った。
  • 中間結果セットが小さいジョインにおいて、k²-triples + は最も高速なシステムであった。また、中間結果が大きい場合でも、特に述語が束縛されている場合には、依然として競争力を持ち続けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。