Skip to main content
QUICK REVIEW

[論文レビュー] A role-free approach to indexing large RDF data sets in secondary memory for efficient SPARQL evaluation

George Fletcher, Peter W. Beck|ArXiv.org|Nov 7, 2008
Semantic Web and Ontologies参考文献 21被引用数 4
ひとこと要約

本稿では、大規模なRDFデータセット向けに、三元組や役割ペアではなく、原子(主語、述語、目的語)を直接インデックス化するロールフリーなインデックス技法TripleTを提案する。単一のB+木を用いる。MAP や HexTree といった最先端の手法と比較して、インデックスサイズを最大8桁減少させ、クエリのI/Oコストを最大2桁改善する。

ABSTRACT

Massive RDF data sets are becoming commonplace. RDF data is typically generated in social semantic domains (such as personal information management) wherein a fixed schema is often not available a priori. We propose a simple Three-way Triple Tree (TripleT) secondary-memory indexing technique to facilitate efficient SPARQL query evaluation on such data sets. The novelty of TripleT is that (1) the index is built over the atoms occurring in the data set, rather than at a coarser granularity, such as whole triples occurring in the data set; and (2) the atoms are indexed regardless of the roles (i.e., subjects, predicates, or objects) they play in the triples of the data set. We show through extensive empirical evaluation that TripleT exhibits multiple orders of magnitude improvement over the state of the art on RDF indexing, in terms of both storage and query processing costs.

研究の動機と目的

  • 大規模なRDFデータに対して、従来のネイティブRDFインデックス技法のストレージ効率とクエリパフォーマンスの低さを是正すること。
  • MAP や HexTree といったロールベースのインデックス技法が複数のインデックスを必要とし、高いストレージオーバーヘッドを負うという制限を克服すること。
  • すべてのネイティブBGP結合タイプをロール固有のインデックスに依存せずにサポートできる、軽量でスケーラブルなインデックス構造を設計すること。
  • 二次記憶環境において、原子レベルのロールフリーインデックスが、優れたパフォーマンスと空間効率を達成できることを示すこと。

提案手法

  • 三元組の原子(主語、述語、目的語)を、三元組内の役割を区別せずに、単一のB+木に直接インデックス化する。
  • SP、SO、OPの3つの別々のB+木構造を用い、それぞれが特定の順序で原子のペアを格納し、ペイロードに残りの1つの原子を含める。
  • TripleTではSP、SO、OPの3つのB+木のみを物化し、重複する対称的な順序を避けることで、インデックスサイズを削減する。
  • すべての6種類のBGP結合タイプ(例:主語-目的語、述語-目的語)を、3つのB+木構造を活用して効率的な結合処理が可能となるように実装する。
  • 性能評価には標準的なI/Oコストモデル(ブロックリード)を用い、MAP や HexTree と技術に依存しない比較を保証する。
  • すべてのシステムを8KBのディスクブロックと32ビットポインタを用いた仮想記憶環境で実装し、再現性と一貫性を確保するためにPython 2.5.2を用いる。

実験結果

リサーチクエスチョン

  • RQ1ロールを区別しないインデックス手法で、原子を直接インデックス化することで、MAP や HexTree といったロールベースのインデックス技法よりも優れたストレージ効率を達成できるか?
  • RQ2ロールの区別をしない原子インデックス化は、特に複雑なBGP結合に対して、より速いSPARQLクエリ評価を実現するか?
  • RQ3MAP や HexTree が使用する複数のB+木構造と比較して、原子ペア用の単一B+木構造がどれほど優れた性能を示すか?
  • RQ4TripleTの手法は、DBPedia や UniProt といった合成データおよび実世界のRDFデータセットにおいて、どのようにスケーリングするか?
  • RQ5TripleTのパフォーマンス向上は、すべてのネイティブBGP結合パターンのサポートを犠牲にすることなく達成できるか?

主な発見

  • TripleTは、MAP や HexTree と比較して、インデックスサイズを最大8桁削減する。これは、1つのB+木を用い、キーのサイズも小さいことが主な要因である。
  • 単一三元組検索(k=0)において、TripleTはMAP や HexTree と同等または優れたパフォーマンスを示し、顕著に低いI/Oコストを達成する。
  • 基本グラフパターン(BGP)結合(k=1)において、すべてのデータセットでMAP や HexTree と比較して、I/Oコストで最大2桁の改善を達成する。
  • TripleTにおける平均ペイロードサイズは1つのディスクブロックに収まり、マージ結合における効率的なメモリ内処理が可能で、追加のI/Oオーバーヘッドが生じない。
  • TripleTのパフォーマンス優位性は、合成データ、DBPedia、UniProtのすべてのデータセットで一貫しており、多様なRDFデータ特性にわたる堅牢性を示している。
  • MAP や HexTree で用いられるキーコンプレッションなどの最適化は、TripleTに対しても直接適用可能であり、さらにストレージ削減を実現しながらも、パフォーマンスの利点を保持できる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。