[论文解读] Computing FO-Rewritings in EL in Practice: from Atomic to Conjunctive Queries
本文提出了一种实用、正确且完备的方法,用于在描述逻辑 $ε\mathcal{L}$ 中计算本体中介查询(OMQ)的一阶(FO)重写,当查询为合取查询(CQ)时。该方法通过将问题约化为基于原子查询(AQ)的重写,扩展了针对原子查询的分解式逆向链算法,实现了对树量化和根式CQ的多项式时间计算,并在ENVO和not-galen等真实本体上实验表明性能高效。
A prominent approach to implementing ontology-mediated queries (OMQs) is to rewrite into a first-order query, which is then executed using a conventional SQL database system. We consider the case where the ontology is formulated in the description logic EL and the actual query is a conjunctive query and show that rewritings of such OMQs can be efficiently computed in practice, in a sound and complete way. Our approach combines a reduction with a decomposed backwards chaining algorithm for OMQs that are based on the simpler atomic queries, also illuminating the relationship between first-order rewritings of OMQs based on conjunctive and on atomic queries. Experiments with real-world ontologies show promising results.
研究动机与目标
- 为在描述逻辑 $ε\mathcal{L}$ 中当查询为合取查询(CQ)时,实现本体中介查询(OMQ)的一阶重写的高效、正确且完备计算。
- 解决从CQ到原子查询的朴素约化在正确性和效率方面均失败的问题,特别是因为组成原子的FO-重写可判定性既非CQ可进行FO-重写的必要条件也非充分条件。
- 通过引入基于约化的策略,将现有针对原子查询的分解式逆向链算法扩展至处理CQ,以保持重写可判定性并实现实际性能。
- 在真实本体上对方法进行实证评估,证明尽管CQ相比原子查询复杂度更高,该方法仍具备可扩展性和高效性。
提出的方法
- 通过构建一个新的OMQ,将合取查询(CQ)中的每个原子视为独立查询,从而将CQ约化为一组原子查询(AQs),并利用查询图的结构。
- 对于树量化CQ(tqCQs),该约化为多项式时间,并确保变换后OMQ的FO-重写可判定性意味着原始CQ的FO-重写可判定性。
- 该方法依赖于先前工作中提出的分解式逆向链算法,该算法支持结构共享,并确保重写以避免引入不必要的原子。
- 假设约化后OMQ的一阶重写为树状CQ的并集(UCQ),这一条件由分解算法自然满足。
- 对于根式CQ(rCQs),该方法未实现黑箱约化,而是利用算法内部行为,将来自约化OMQ的重写传播回原始CQ。
- 实现将这些约化集成到Grind系统中,利用现有的分解式逆向链引擎,高效计算重写。
实验结果
研究问题
- RQ1尽管该问题具有理论复杂性,是否能够在实践中高效且完整地计算 $ε\mathcal{L}$ 中合取查询的一阶重写?
- RQ2是否存在一种方法,可将CQ的FO-重写可判定性问题约化为原子查询的FO-重写可判定性问题,同时不损失正确性或效率?
- RQ3CQ的哪些结构限制(如树量化或根式)允许实现到原子查询重写的多项式时间约化,同时保持重写可判定性?
- RQ4所提方法在具有复杂模式和大规模数据实例的真实本体上的性能如何扩展?
- RQ5底层重写算法的哪些特性(如结构共享、避免冗余原子)使得能够将重写从约化OMQ传递到原始CQ?
主要发现
- 该方法成功实现了对 $ε\mathcal{L}$ 中所有非布尔合取查询的FO-重写,当查询为根式或树量化时,其约化为原子查询重写的计算为多项式时间。
- 在五个真实本体(ENVO、FBbi、SO、MOHSE、not-galen)上的实验表明,CQ重写的平均运行时间低于10秒,最慢的查询耗时2分23秒。
- 仅三个查询(共50个)在30分钟内未终止或耗尽内存,全部涉及不可进行FO-重写的原子子查询,触发了昂贵的处理阶段。
- 计算组成原子查询的FO-重写平均时间(Avg AQ)显著低于完整CQ的重写时间,表明CQ重写过程更耗时但仍在实用范围内。
- 考虑到系统尚未经过深度优化,且在包含最多4,636个概念包含和2,748个概念名称的本体上表现良好,性能表现令人鼓舞。
- 结果证实,即使对于复杂CQ,$ε\mathcal{L}$ 中的FO-重写在实践中高度可行,尤其当查询结构简单(如根式或树状)时。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。