[论文解读] Un index de jointure pour les entrepôts de données XML
本文提出了一种专为XML数据仓库设计的新型连接索引结构,旨在消除XQuery连接操作带来的性能开销。通过将事实表和维度数据重新组织为单一优化的XML索引,该方法在复杂、多维查询(含分组操作)中,与未使用索引的本地方XML DBMS相比,查询执行时间最高可减少25,669倍。
XML data warehouses form an interesting basis for decision-support applications that exploit heterogeneous data from multiple sources. However, XML-native database systems currently bear limited performances and it is necessary to research ways to optimize them. In this paper, we propose a new index that is specifically adapted to the multidimensional architecture of XML warehouses and eliminates join operations, while preserving the information contained in the original warehouse. A theoretical study and experimental results demonstrate the efficiency of our index, even when queries are complex.
研究动机与目标
- 解决本地方XML DBMS在处理复杂、多连接决策支持查询时性能不佳的问题。
- 设计一种索引结构,在消除连接操作成本的同时,保留XML数据仓库的多维模式。
- 优化涉及多个路径表达式、分组和聚合操作的XQuery工作负载的查询执行性能。
- 通过理论分析和在本地方XML DBMS(eXist)上的真实世界实验验证该索引。
- 扩展XQuery语法以支持多个GROUP BY子句,实现完整的OLAP功能。
提出的方法
- 所提出的索引将事实表和维度数据重新组织为一个类似星型模式的单一XML结构,其中维度键和事实值以嵌入属性形式表示。
- 索引中的每个单元格包含带有@id和@node属性的维度节点,以及带有@id和@value属性的事实节点,用于表示度量值。
- 通过深度优先和广度优先搜索遍历维度节点,可直接访问事实值,避免了需连接多个文档的需要。
- 应用查询重写技术,将包含多个连接的标准XQuery转换为对单一索引的遍历操作,充分利用索引的层次结构。
- 理论成本分析比较了本地方XQuery(含连接)与索引方法的执行成本,显示出复杂度显著降低。
- 实验在基于eXist本地方XML DBMS的XCube真实XML数据仓库上进行,通过改变数据大小并测量使用和不使用索引时的执行时间。
实验结果
研究问题
- RQ1专用索引结构能否消除XML数据仓库查询中多连接操作带来的性能损耗?
- RQ2在复杂、多维XQuery工作负载下,该索引与本地方XML DBMS执行相比,查询执行时间有何差异?
- RQ3该索引在多大程度上保持了XML仓库原始数据语义和多维模式?
- RQ4该索引能否支持XQuery中的复杂分析操作,如多级GROUP BY和聚合?
- RQ5随着数据量和查询复杂度的增加,该索引的可扩展性如何?
主要发现
- 理论分析表明,该索引将查询执行成本从O(|Cell| * |Dimension| * (|Dimension| + |di| * |ai|))降低至O(|Cell| * (|Dimension| + |ai|)),消除了主导的连接成本因素。
- 实验评估显示,与未使用索引的本地方XQuery执行相比,该索引将平均查询执行时间减少了25,669倍。
- 使用该索引时,系统在两秒内处理完整个事实表(4.92 MB),而未使用索引时则无法在合理时间内返回结果。
- 性能提升在不同数据规模下保持一致,实验结果与理论预测高度吻合。
- 该索引成功支持了包含多个GROUP BY子句的复杂XQuery查询,而这些查询在标准XQuery中并不原生支持。
- 结果表明,该索引在XML数据仓库中大规模、复杂决策支持工作负载下依然有效。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。