Skip to main content
QUICK REVIEW

[论文解读] Query Answering under Matching Dependencies for Data Cleaning: Complexity and Algorithms

Jaffer Gardezi, Leopoldo Bertossi|arXiv (Cornell University)|Dec 27, 2011
Data Quality and Management参考文献 30被引用 3
一句话总结

本文研究了在数据清洗中匹配依赖(MDs)下的查询回答问题,提出系统化的复杂度分析与一种新颖的查询重写方法,以高效计算所有最小化解实例(MRIs)中保持不变的解析答案。主要贡献在于针对MD集合的二分法结果,以及使用带递归和聚合的正Datalog构建的可 tractable 重写框架,使得在某些合取查询与MD类别上可实现多项式时间评估。

ABSTRACT

Matching dependencies (MDs) have been recently introduced as declarative rules for entity resolution (ER), i.e. for identifying and resolving duplicates in relational instance $D$. A set of MDs can be used as the basis for a possibly non-deterministic mechanism that computes a duplicate-free instance from $D$. The possible results of this process are the clean, "minimally resolved instances" (MRIs). There might be several MRIs for $D$, and the "resolved answers" to a query are those that are shared by all the MRIs. We investigate the problem of computing resolved answers. We look at various sets of MDs, developing syntactic criteria for determining (in)tractability of the resolved answer problem, including a dichotomy result. For some tractable classes of MDs and conjunctive queries, we present a query rewriting methodology that can be used to retrieve the resolved answers. We also investigate connections with "consistent query answering", deriving further tractability results for MD-based ER.

研究动机与目标

  • 系统分析在匹配依赖(MDs)下计算合取查询解析答案的计算复杂度。
  • 识别区分MDs下解析查询回答问题中可 tractable 与不可 tractable 情况的句法标准。
  • 开发一种查询重写方法,可直接从原始脏数据实例中检索解析答案,而无需计算所有MRIs。
  • 建立基于MD的实体识别与基于主键约束的一致性查询回答(CQA)之间的联系,利用现有的CQA结果。
  • 通过向CQA的归约与基于聚合的查询重写,将可 tractable 查询类扩展至合取查询之外。

提出的方法

  • 提出一种类似chase的算法,通过迭代应用MDs从脏数据库中计算最小化解实例(MRIs),确保最小修改。
  • 引入解析答案的概念:即在所有MRIs中共享的答案,避免显式物化所有MRIs。
  • 开发一种查询重写算法,将合取查询转换为可在带递归和聚合的正Datalog中表达的新查询,该查询可在原始脏实例上以多项式时间评估。
  • 应用二分法结果,根据句法属性将两MD集合分类为PTIME或NP-hard(在数据上)。
  • 建立从基于MD的解析查询回答到一致查询回答(CQA)的归约,以主键约束(KCs)为基础。
  • 在一阶逻辑扩展中使用聚合(COUNT),以捕捉具有相同主键的元组组中的频繁值,从而实现对非UJCQ查询的高效重写。

实验结果

研究问题

  • RQ1在何种句法条件下,基于MDs计算解析答案是可 tractable 或不可 tractable 的?
  • RQ2合取查询能否被重写为一种新查询,使其可直接从原始脏数据库实例中计算出解析答案?
  • RQ3基于MDs的解析查询回答的复杂度类与基于主键约束的一致性查询回答(CQA)的复杂度类之间有何关系?
  • RQ4该查询重写方法能否扩展至UJCQ类之外的查询?若可,其条件为何?
  • RQ5聚合与递归在实现多项式时间内高效评估解析答案中起何作用?

主要发现

  • 针对两MD集合,建立了二分法结果:基于句法标准,解析答案计算要么在PTIME中,要么在数据上为NP-hard。
  • 对于某些可 tractable 的MD与合取查询类别,可使用带递归和聚合的正Datalog实现多项式时间可计算的查询重写。
  • 重写后的查询虽不总是一阶逻辑表达式,但可在多项式时间内评估,并在原始脏实例上精确返回解析答案。
  • 正式建立了基于MD的实体识别与一致查询回答(CQA)之间的联系,使得CQA中的可 tractability 结果可转移至MDs。
  • 该方法超越了UJCQ类:例如,即使查询不在UJCQ类中,仍可通过聚合与基于CQA的重写实现重写,如示例22所示。
  • 重写查询中使用聚合(COUNT)可捕捉具有相同主键的元组组中的最频繁值,从而实现高效解析,而无需显式计算MRIs。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。