Skip to main content
QUICK REVIEW

[论文解读] Simple Schemas for Unordered XML

Iovka Boneva, Radu Ciucanu|arXiv (Cornell University)|Mar 18, 2013
Advanced Database Systems and Queries参考文献 21被引用 8
一句话总结

本文提出了析取多重性模式(DMS)及其限制形式——无析取多重性模式(MS),作为无序XML的轻量级、人类可读的模式形式化,保留了DTD的大部分表达能力,同时不增加计算复杂度。主要贡献在于对静态分析问题(如模式可满足性、成员关系、包含关系和查询等价性)的正式刻画,表明DMS与MS在核心任务中保持多项式时间复杂度,同时准确建模了现实世界数据为中心的XML应用中的无序内容模型。

ABSTRACT

We consider unordered XML, where the relative order among siblings is ignored, and propose two simple yet practical schema formalisms: disjunctive multiplicity schemas (DMS), and its restriction, disjunction-free multiplicity schemas (MS). We investigate their computational properties and characterize the complexity of the following static analysis problems: schema satisfiability, membership of a tree to the language of a schema, schema containment, twig query satisfiability, implication, and containment in the presence of schema. Our research indicates that the proposed formalisms retain much of the expressiveness of DTDs without an increase in computational complexity.

研究动机与目标

  • 为解决DTD在建模无序XML内容时的局限性,即由于顺序敏感性导致正则表达式过度近似的问题。
  • 设计直观、人类可读且语义精确的模式形式化,适用于兄弟节点顺序无关的数据为中心的XML应用。
  • 刻画在新形式化下基本静态分析问题(如模式包含、查询可满足性)的计算复杂度。
  • 评估DMS与MS是否保留在数据为中心的上下文中建模真实世界DTD的充分表达能力。
  • 探索这些形式化是否为无序XML提供一种实用的DTD替代方案,实现表达能力与效率的平衡。

提出的方法

  • 提出析取多重性模式(DMS),通过多重性符号(*、+、?、1)和无序连接(||)定义无序内容模型,并使用受限析取(|)表示可选分支。
  • 引入无析取多重性模式(MS)作为DMS的限制形式,排除析取操作,简化分析同时保留关键表达能力。
  • 定义模式的通用依赖图(UDG),以捕获结构约束,并支持twig查询的高效嵌入检查。
  • 通过UDG的展开来刻画模式的最小树语言,确保在交换律闭包下所有有效文档均被正确捕获。
  • 应用泵引理证明:无序内容的正则表达式可能需要指数级大小,从而证明更紧凑形式化的需求。
  • 利用图嵌入技术将模式与查询包含问题归约为子图同构问题,支持复杂度分析。

实验结果

研究问题

  • RQ1DMS与MS形式化是否能以与DTD相同的方式建模无序XML文档集合,同时避免正则表达式因过度宽松导致的过度包容性?
  • RQ2在DMS与MS下,核心静态分析任务(如模式成员关系、包含关系和查询蕴含)的计算复杂度如何?
  • RQ3对无析取模式(MS)的限制是否在现实世界数据为中心的XML应用中保留了足够的表达能力?
  • RQ4在XMark和阿姆斯特丹大学XML网络数据集等真实世界XML基准测试中,DMS与MS与DTD在表达能力上的对比如何?
  • RQ5所提出的形式化是否能支持无序XML中高效查询优化与验证,特别是针对twig查询?

主要发现

  • XMark基准测试中的77个正则表达式全部被DMS规则捕获,其中76个被MS规则捕获,表明其具有强大的表达覆盖能力。
  • 阿姆斯特丹大学XML网络数据集中84%的唯一正则表达式被DMS捕获,74.6%被MS捕获,证明其在实际应用中的相关性。
  • 阿姆斯特丹大学数据集中55.5%的完整DTD被DMS捕获,45.8%被MS捕获,表明其在真实世界数据为中心的模式中具有广泛适用性。
  • MS下的模式蕴含(IMPL)与twig查询属于PTIME,而模式包含(CNT)为coNP完全,表明核心分析具有可 tractability。
  • 无析取DTD的通用依赖图展开可生成其语言中的最小树,从而支持正确且高效的查询包含检查。
  • DMS中使用受限正则表达式并结合交换律闭包,避免了传统过度宽松DTD中常见的指数级膨胀,同时保持语义精确性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。