Skip to main content
QUICK REVIEW

[论文解读] Mapping XML Data to Relational Data: A DOM-Based Approach

Mustafa Atay, Yezhou Sun|arXiv (Cornell University)|Oct 8, 2010
Advanced Database Systems and Queries参考文献 12被引用 13
一句话总结

本文提出 XInsert,一种基于 DOM 的线性时间算法,用于将 XML 数据映射到关系型数据库。通过遍历 DOM 树并应用基于内联的模式映射,该算法高效地将 XML INSERT 语句转换为一系列 SQL INSERT 语句,实现 n 个 XML 元素和属性的 O(n) 时间复杂度。

ABSTRACT

XML has emerged as the standard for representing and exchanging data on the World Wide Web. It is critical to have efficient mechanisms to store and query XML data to exploit the full power of this new technology. Several researchers have proposed to use relational databases to store and query XML data. While several algorithms of schema mapping and query mapping have been proposed, the problem of mapping XML data to relational data, i.e., mapping an XML INSERT statement to a sequence of SQL INSERT statements, has not been addressed thoroughly in the literature. In this paper, we propose an efficient linear algorithm for mapping XML data to relational data. This algorithm is based on our previous proposed inlining algorithm for mapping DTDs to relational schemas and can be easily adapted to other inlining algorithms.

研究动机与目标

  • 解决 XML 到关系型数据库映射中尚未充分探索的问题,特别是将 XML INSERT 语句转换为 SQL INSERT 语句。
  • 开发一种与现有模式映射技术(尤其是基于内联的方法)协同工作的高效算法。
  • 通过利用 DOM 树遍历,确保数据映射过程可扩展,并在大规模 XML 文档上表现良好。
  • 为各种基于内联的模式映射算法(而不仅限于作者提出的 DTDMap)提供可适应的基础。

提出的方法

  • 使用文档对象模型(DOM)将 XML 文档表示为内存中的树结构,以实现系统的遍历。
  • 应用两阶段算法:首先识别不可内联的元素并进行处理;其次通过递归遍历处理可内联的元素。
  • 仅将每个 XML 元素插入到关系型表中一次,确保无重复,并在插入过程中保持参照完整性。
  • 利用先前模式映射(如 DTDMap)中的内联技术,减少表的数量并最小化连接操作。
  • 使用 while 循环处理不可内联的元素,另用一个 while 循环处理可内联的元素,两者均以线性时间运行。
  • 确保每个 DOM 节点仅被访问一次,从而保证时间复杂度为 O(n),其中 n 为 XML 元素和属性的总数。

实验结果

研究问题

  • RQ1如何使用基于 DOM 的方法高效地将 XML 数据映射到关系型数据库?
  • RQ2通过 DOM 树遍历和内联技术处理 XML 文档的数据映射算法的时间复杂度是多少?
  • RQ3所提出的算法在 XML 文档大小增加时性能如何扩展?
  • RQ4该算法在具有不同结构特征的 XML 文档(例如以文档为中心 vs. 以数据为中心)上的表现如何?

主要发现

  • XInsert 算法实现 O(n) 时间复杂度,其中 n 为 XML 元素和属性的数量,因此为线性且高度高效。
  • 该算法在以数据为中心的(catalog.dtd)和以文档为中心的(auction.dtd)XML 文档上均表现良好,且具有稳定的线性扩展性。
  • 当文档大小达到 40 MB 时,性能开始下降,原因是 DOM 树超出主内存,需进行磁盘交换。
  • auction.dtd 文档包含深度嵌套的递归文本元素,处理时间长于 catalog.dtd,尤其在 50 MB 时更为明显,因树的深度增加。
  • 该算法在不同模式映射方案(包括 DTDMap 和共享内联)下表现稳定且可预测。
  • 该算法可轻松适配其他基于内联的模式映射技术,增强了其可重用性和可扩展性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。