[论文解读] A Hybrid Approach to Query Answering under Expressive Datalog+/-
本文提出了两种新颖的确定性算法,用于弱粘性(WS)Datalog±中的合取查询回答,这是一种表达能力极强的知识图谱语言。第一种算法采用基于查询驱动、可恢复的 chase 过程,生成与查询相关的数据库扩展;第二种算法则通过将程序转换为粘性程序,再结合标准重写技术实现。两种方法均实现了最优的数据复杂度(ptime),使得在真实世界 OBDA 场景中能够高效、实用地进行查询回答。
Datalog+/- is a family of ontology languages that combine good computational properties with high expressive power. Datalog+/- languages are provably able to capture the most relevant Semantic Web languages. In this paper we consider the class of weakly-sticky (WS) Datalog+/- programs, which allow for certain useful forms of joins in rule bodies as well as extending the well-known class of weakly-acyclic TGDs. So far, only non-deterministic algorithms were known for answering queries on WS Datalog+/- programs. We present novel deterministic query answering algorithms under WS Datalog+/-. In particular, we propose: (1) a bottom-up grounding algorithm based on a query-driven chase, and (2) a hybrid approach based on transforming a WS program into a so-called sticky one, for which query rewriting techniques are known. We discuss how our algorithms can be optimized and effectively applied for query answering in real-world scenarios.
研究动机与目标
- 为解决弱粘性(WS)Datalog± 这一高度表达但可判定的知识图谱语言中合取查询回答缺乏确定性算法的问题。
- 克服以往研究中对非确定性 chase 过程的依赖,从而阻碍实际部署的问题。
- 开发高效、可扩展的查询回答技术,在保持可判定性的同时支持复杂连接和存在量词规则。
- 通过优化的确定性算法,实现真实世界基于本体的数据访问(OBDA)系统中的实际部署。
- 在 WS Datalog± 下实现合取查询回答的最优数据复杂度(ptime),达到理论下限。
提出的方法
- 提出一种基于查询驱动、可恢复的自底向上 chase 算法,其数据库扩展过程按查询中存在量词变量的数量分步进行。
- 采用两阶段转换:首先通过 Skolem 化和标注消除有限秩的存在量词变量,然后对零秩变量进行部分规约,生成粘性程序。
- 利用标准重写技术处理粘性 Datalog±,将原始查询转换为合取查询的并集(UCQs)。
- 直接在原始数据库实例上对重写后的 UCQs 进行评估,支持类似 SQL 的高效执行。
- 通过依赖图分析优化规约过程,避免在某些常量无法生成新原子时进行不必要的规则扩展。
- 结合离线预计算扩展(最多 m 个存在量词变量)与按需恢复机制,支持增量查询处理。
实验结果
研究问题
- RQ1是否可以在表达能力强大的 WS Datalog± 语言中实现确定性且高效的查询回答,该语言扩展了粘性和弱无环 Datalog±?
- RQ2如何修改 chase 过程,以确保终止性和确定性,同时保持查询驱动和高效性?
- RQ3通过转换为粘性程序的混合方法是否能保持查询答案,同时支持现有高效的重写技术?
- RQ4WS Datalog± 下合取查询回答的数据复杂度是多少?是否可达到 ptime?
- RQ5如何优化规约过程,以避免在转换过程中生成冗余原子?
主要发现
- 所提出的查询驱动 chase 算法在 WS Datalog± 下实现了最优的数据复杂度(ptime),其扩展过程具有确定性和查询特异性。
- 混合方法通过 Skolem 化和部分规约将 WS 程序转换为粘性程序,从而可复用现有高效的粘性 Datalog± 重写技术。
- 两种算法均达到数据复杂度的最优 ptime 下限,证实了其理论效率与实际可行性。
- 第一种算法通过预计算最多含 m 个存在量词变量的查询扩展,支持增量查询处理,实现结果复用与按需扩展。
- 第二种算法通过在原始数据库上对重写后的 UCQs 进行标准 SQL 风格处理,实现高效评估,便于与 RDBMS 集成。
- 通过依赖图分析进行优化,可减少重写阶段生成的 CQ 数量,避免不必要的规约步骤。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。