Skip to main content
QUICK REVIEW

[论文解读] SHARE: A Web Service Based Framework for Distributed Querying and Reasoning on the Semantic Web

Benjamin P. Vandervalk, Erin McCarthy|arXiv (Cornell University)|May 20, 2013
Biomedical Text Mining and Ontologies参考文献 19被引用 7
一句话总结

SHARE 引入了一种基于网络服务的框架,扩展了 SPARQL 查询引擎和 OWL 推理器,以实现在语义网数据上的分布式查询与推理。通过将网络服务调用视为 RDF 三元组的生成,并利用反向服务实现高效的数据过滤,SHARE 允许在无需集中数据聚合的情况下,对大规模、分布式的生物医学数据集进行可扩展的去中心化推理与查询。

ABSTRACT

Here we describe the SHARE system, a web service based framework for distributed querying and reasoning on the semantic web. The main innovations of SHARE are: (1) the extension of a SPARQL query engine to perform on-demand data retrieval from web services, and (2) the extension of an OWL reasoner to test property restrictions by means of web service invocations. In addition to enabling queries across distributed datasets, the system allows for a target dataset that is significantly larger than is possible under current, centralized approaches. Although the architecture is equally applicable to all types of data, the SHARE system targets bioinformatics, due to the large number of interoperable web services that are already available in this area. SHARE is built entirely on semantic web standards, and is the successor of the BioMOBY project.

研究动机与目标

  • 解决语义网中针对分布式 RDF 数据集缺乏可扩展、去中心化的查询与推理基础设施的问题。
  • 克服集中式 SPARQL 引擎和推理器的局限性,这些系统需要完整下载数据集。
  • 在不进行数据集中化的情况下,实现在异构、分布式生物信息学网络服务上的语义网推理与查询。
  • 在 BioMOBY 框架的基础上,将其自定义 XML 格式替换为对 W3C 语义网标准(RDF、OWL、SPARQL)的完整遵循。
  • 允许用户使用 OWL 类定义高层级、模块化的查询,这些查询通过网络服务调用自动解析。

提出的方法

  • 扩展 SPARQL 引擎,使其在需要时动态调用网络服务,而非依赖预取数据,将每次服务调用视为生成一个 RDF 三元组。
  • 采用基于谓词的映射机制,其中每个网络服务定义一个语义关系(谓词),连接输入(主语)与输出(宾语),形成一个 RDF 三元组。
  • 引入“反向服务”(inverse services),预先计算并缓存服务输入的反向映射,从而在完整查询执行前高效过滤无关数据。
  • 增强 OWL 推理器,通过动态调用网络服务来检索复杂类定义中的属性值,以验证属性限制。
  • 以标准语义网技术为基础:所有输入和输出均以由 OWL 类描述的 RDF 文档形式表达。
  • 通过允许在 SPARQL 中直接引用 OWL 类(如 'ParkinsonTranscriptionFactor'),支持模块化、可组合的查询,实例检索由服务调用驱动。

实验结果

研究问题

  • RQ1如何在不完全复制数据的前提下,使 SPARQL 查询在分布式、由网络服务托管的 RDF 数据集上高效运行?
  • RQ2能否通过动态调用网络服务解析属性值,在分布式数据源之间执行 OWL 推理?
  • RQ3哪些架构模式能够支持在大规模、去中心化的生物医学数据上实现可扩展的推理与查询?
  • RQ4如何将现有的生物信息学网络服务语义化地集成到统一的、基于标准的查询与推理框架中?
  • RQ5在分布式环境中,反向服务的使用在多大程度上可以降低查询引擎和推理器的计算负载?

主要发现

  • SHARE 通过动态调用网络服务检索数据,实现了跨分布式数据集的 SPARQL 查询执行,消除了下载整个数据集的需要。
  • 反向服务的使用使系统能够预先过滤无关数据,显著减少了查询引擎和推理器需要处理的数据量。
  • 通过调用网络服务解析属性值,OWL 推理被扩展至跨分布式数据,即使数据未集中存储,也能实现实例的分类。
  • 该框架支持使用 OWL 类(如 'ParkinsonTranscriptionFactor')构建复杂、模块化的查询,这些类由多个属性限制的交集定义,并通过服务调用解析。
  • 系统在生物信息学大规模数据集成方面展示了可行性,其原型应用(CardioSHARE)针对临床心脏病数据,使用领域特定本体。
  • 通过将 BioMOBY 的专有 XML 格式替换为完整的 W3C 标准,SHARE 实现了更广泛的互操作性,并可与现有的语义网工具和工作流无缝集成。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。