Skip to main content
QUICK REVIEW

[论文解读] Materialized View Selection by Query Clustering in XML Data Warehouses

Hadj Mahboubi, Kamel Aouiche|ArXiv.org|Sep 11, 2008
Advanced Database Systems and Queries参考文献 23被引用 20
一句话总结

本文提出了一种基于查询聚类的自动化物化视图选择策略,用于XML数据仓库,以提升查询性能。通过将语义和结构相似的XQuery决策支持查询分组,并物化公共子表达式,该方法显著减少了复杂查询的执行时间,实验结果在基于XCube的XML仓库中已得到验证。

ABSTRACT

XML data warehouses form an interesting basis for decision-support applications that exploit complex data. However, native XML database management systems currently bear limited performances and it is necessary to design strategies to optimize them. In this paper, we propose an automatic strategy for the selection of XML materialized views that exploits a data mining technique, more precisely the clustering of the query workload. To validate our strategy, we implemented an XML warehouse modeled along the XCube specifications. We executed a workload of XQuery decision-support queries on this warehouse, with and without using our strategy. Our experimental results demonstrate its efficiency, even when queries are complex.

研究动机与目标

  • 解决用于决策支持应用的原生XML数据库管理系统中的性能瓶颈问题。
  • 通过选择最优物化视图来减少XML数据仓库中的查询执行时间。
  • 使用数据挖掘技术自动化视图选择过程,而非依赖手动调优。
  • 评估查询聚类在识别可重用查询模式以用于视物化方面的有效性。
  • 在复杂的真实XQuery工作负载上,展示所提策略的可扩展性和高效性。

提出的方法

  • 使用数据挖掘技术对XQuery决策支持查询的工作负载进行聚类,以分组语义和结构相似的查询。
  • 分析查询模式,识别适合物化的公共子表达式和结构特征。
  • 根据聚类特征(如频率和结构重叠度)选择物化视图。
  • 根据XCube规范实现XML数据仓库,以确保标准化和可扩展性。
  • 在有和没有物化视图的情况下执行查询工作负载,以衡量性能提升。
  • 使用基于成本的评估方法,优先选择单位存储成本下性能增益最大的视图。

实验结果

研究问题

  • RQ1如何有效应用查询聚类来识别XML数据仓库中物化视图的最优选择?
  • RQ2查询聚类在XML决策支持系统中对复杂XQuery查询的执行时间减少程度如何?
  • RQ3基于聚类查询工作负载的物化视图选择与随机或启发式选择相比,其影响如何?
  • RQ4所提策略是否可扩展至大规模和复杂的XML数据仓库工作负载?
  • RQ5性能增益如何随不同聚类粒度和视图选择策略而变化?

主要发现

  • 所提出的基于查询聚类的物化视图选择策略显著减少了XML数据仓库中的查询执行时间。
  • 即使对于复杂XQuery查询,性能提升在工作负载中也表现出可测量且一致的效果。
  • 该方法在不同查询模式和数据结构下表现出良好的可扩展性和适应性。
  • 从聚类查询中导出的物化视图相比非聚类方法,具有更高的重用率和更好的性能增益。
  • 在基于XCube的XML仓库上的实验结果证实了该策略在真实世界决策支持场景中的有效性。
  • 该方法在无需手动调优或事先了解查询模式的情况下,实现了显著的性能提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。