Skip to main content
QUICK REVIEW

[论文解读] Consistent query answers on numerical databases under aggregate constraints

Sergio Flesca, Filippo Furfaro|ArXiv.org|May 23, 2005
Data Management and Algorithms参考文献 6被引用 5
一句话总结

本文提出了一种修复违反聚合约束的数值关系数据库的框架——这些聚合约束是基于求和查询的线性不等式——通过修改属性值而非插入或删除元组来实现。该文确定了在集合最小化和基数最小化语义下一致查询回答的计算复杂度,表明在集合最小化语义下,判断一致答案是 Π₂^p-完全的,而在基数最小化语义下,判断一致答案是 Δ₂^p[log n]-完全的。

ABSTRACT

The problem of extracting consistent information from relational databases violating integrity constraints on numerical data is addressed. In particular, aggregate constraints defined as linear inequalities on aggregate-sum queries on input data are considered. The notion of repair as consistent set of updates at attribute-value level is exploited, and the characterization of several complexity issues related to repairing data and computing consistent query answers is provided.

研究动机与目标

  • 填补现有研究中关于不一致数据修复的空白,现有研究集中于主键或函数依赖,而未涉及数值数据上的聚合约束。
  • 将由自动获取过程(如OCR、传感器网络)引发的数据不一致建模为对聚合求和约束的违反。
  • 提供一个正式框架,通过在属性级别更新属性值而非插入或删除元组,来修复不一致的数值数据库。
  • 对两种修复语义(集合最小化和基数最小化)下的一致查询回答的计算复杂度进行表征。
  • 在数据不一致源于识别或传感错误而非数据丢失或插入的场景中,实现可靠查询回答。

提出的方法

  • 将聚合约束定义为数值属性求和聚合上的线性不等式(例如,总收款 = 明细收款之和)。
  • 将修复建模为恢复与聚合约束一致的最小属性值更新集合。
  • 引入两种最小修复语义:集合最小化(最小更新集合)和基数最小化(最少更新属性数)。
  • 将一致查询答案形式化为在相应语义下所有最小修复中均出现的元组。
  • 使用逻辑和复杂性理论技术分析一致查询评估的可判定性与复杂度。
  • 基于数据库理论和计算复杂性中的正式定义,构建查询答案和修复的形式化基础。

实验结果

研究问题

  • RQ1当修复必须满足集合最小化语义时,判断一致查询答案的计算复杂度是什么?
  • RQ2当使用基数最小化修复而非集合最小化修复时,同一类约束下的复杂度如何变化?
  • RQ3在不一致源于符号识别或传感器错误的数值数据库中,能否可靠计算一致查询答案?
  • RQ4当聚合约束为非线性时,修复存在的可判定性条件是什么?
  • RQ5在现实世界数字化数据中,属性级更新与元组级操作相比,在真实性和适用性方面有何差异?

主要发现

  • 在集合最小化语义下判断一致查询答案是 Π₂^p-完全的,表明其具有很高的计算复杂度。
  • 在基数最小化语义下判断一致查询答案是 Δ₂^p[log n]-完全的,反映出一个稍受限制但仍属高复杂度的复杂度类。
  • 该框架支持现实中的数据修复场景,如OCR数字化或传感器网络,其中仅属性值可能出错,而非整个元组。
  • 当假设错误数量最少时(如符号误识别或瞬时传感器故障),基数最小化语义是合理的。
  • 集合最小化语义更具包容性,适用于无法对错误源作任何假设的场景,能够保留所有最小修复配置。
  • 本文指出,当聚合约束扩展为包含属性之间的乘积(非线性形式)时,修复存在的问题在一般情况下变为不可判定。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。