Skip to main content
QUICK REVIEW

[论文解读] A role-free approach to indexing large RDF data sets in secondary memory for efficient SPARQL evaluation

George Fletcher, Peter W. Beck|ArXiv.org|Nov 7, 2008
Semantic Web and Ontologies参考文献 21被引用 4
一句话总结

本文提出TripleT,一种针对大规模RDF数据集的无角色索引技术,该技术直接对原子(主体、谓词、客体)进行索引而非三元组或角色对,仅使用单个B+树。与最先进的方法(如MAP和HexTree)相比,其索引大小最多减少八数量级,查询I/O成本最多提升两个数量级。

ABSTRACT

Massive RDF data sets are becoming commonplace. RDF data is typically generated in social semantic domains (such as personal information management) wherein a fixed schema is often not available a priori. We propose a simple Three-way Triple Tree (TripleT) secondary-memory indexing technique to facilitate efficient SPARQL query evaluation on such data sets. The novelty of TripleT is that (1) the index is built over the atoms occurring in the data set, rather than at a coarser granularity, such as whole triples occurring in the data set; and (2) the atoms are indexed regardless of the roles (i.e., subjects, predicates, or objects) they play in the triples of the data set. We show through extensive empirical evaluation that TripleT exhibits multiple orders of magnitude improvement over the state of the art on RDF indexing, in terms of both storage and query processing costs.

研究动机与目标

  • 解决现有本地图RDF索引技术在大规模RDF数据存储和查询性能方面的低效问题。
  • 克服基于角色的索引(如MAP、HexTree)需要多个索引且存储开销高的局限性。
  • 设计一种轻量级、可扩展的索引结构,支持所有本地图模式连接类型,且不依赖于角色特定的索引。
  • 证明原子级别、无角色的索引可在二级存储环境中实现更优的性能与空间效率。

提出的方法

  • 将RDF三元组中的所有原子(主体、谓词、客体)直接索引到单个B+树中,不区分其在三元组中的角色。
  • 使用三个独立的B+树结构——SP、SO和OP,其中每个结构按特定顺序存储原子对,载荷中包含第三个原子。
  • 仅物化SP、SO和OP三个B+树以构建TripleT,避免冗余的对称排序,从而减少索引大小。
  • 通过利用三个B+树结构,支持所有六种BGP连接类型(如主体-客体、谓词-客体),实现高效的连接处理。
  • 采用标准I/O成本模型(块读取)评估性能,确保与MAP和HexTree的技术无关比较。
  • 所有系统实现均使用8KB磁盘块和32位指针,运行于虚拟内存中,使用Python 2.5.2以保证可复现性和一致性。

实验结果

研究问题

  • RQ1一种直接索引原子的无角色索引方法,是否能在存储效率上优于MAP和HexTree等基于角色的索引技术?
  • RQ2在不区分角色的情况下索引原子,是否能带来更快的SPARQL查询评估速度,尤其是针对复杂的BGP连接?
  • RQ3与MAP和HexTree中使用的多个B+树结构相比,单一B+树结构用于原子对的性能优势有多大?
  • RQ4所提出的TripleT方法在合成数据及真实世界RDF数据集(如DBPedia和UniProt)上的可扩展性如何?
  • RQ5TripleT的性能提升是否在不牺牲对所有本地图模式连接模式支持的前提下实现?

主要发现

  • 与MAP和HexTree相比,TripleT将索引大小最多减少了八个数量级,主要得益于仅使用一个B+树和更小的键大小。
  • 对于单个三元组查找(k=0),TripleT在所有数据集中始终优于或匹配MAP和HexTree的性能,且I/O成本显著更低。
  • 对于基本图模式(BGP)连接(k=1),TripleT在所有数据集上相比MAP和HexTree的I/O成本最多提升两个数量级。
  • TripleT中的平均载荷大小可容纳在一个磁盘块内,从而实现对合并连接的高效内存处理,无需额外I/O开销。
  • TripleT的性能优势在合成数据、DBPedia和UniProt中均保持一致,表明其在不同RDF数据特征下的鲁棒性。
  • MAP和HexTree中使用的键压缩等优化技术可直接应用于TripleT,在保持其性能优势的同时实现进一步的空间压缩。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。