Skip to main content
QUICK REVIEW

[论文解读] Database Reverse Engineering based on Association Rule Mining

Nattapon Pannurat, Nittaya Kerdprasop|arXiv (Cornell University)|Apr 19, 2010
Data Mining Algorithms and Applications参考文献 17被引用 10
一句话总结

本文提出了一种新颖的数据库逆向工程方法,利用关联规则挖掘从遗留数据库实例中自动发现第三范式(3NF)模式。通过应用规则过滤启发式方法管理候选规则的指数级增长,该方法即使在缺乏或不完整文档的情况下,也能有效重建规范化的概念模式。

ABSTRACT

Maintaining a legacy database is a difficult task especially when system documentation is poor written or even missing. Database reverse engineering is an attempt to recover high-level conceptual design from the existing database instances. In this paper, we propose a technique to discover conceptual schema using the association mining technique. The discovered schema corresponds to the normalization at the third normal form, which is a common practice in many business organizations. Our algorithm also includes the rule filtering heuristic to solve the problem of exponential growth of discovered rules inherited with the association mining technique.

研究动机与目标

  • 解决缺乏完整文档的遗留数据库逆向工程挑战。
  • 利用数据挖掘技术从数据库实例中自动推导出规范化概念模式。
  • 通过引入规则过滤启发式方法,克服传统挖掘中关联规则指数级增长的问题。
  • 生成符合第三范式(3NF)的模式,这是商业数据库设计中的标准。
  • 为数据库维护和现代化提供可扩展且实用的解决方案。

提出的方法

  • 该方法将关联规则挖掘应用于关系数据库实例,以识别函数依赖。
  • 从表示表元组的事务数据中生成候选规则。
  • 应用规则过滤启发式方法,消除冗余或无信息的规则,从而缩小搜索空间。
  • 从过滤后的规则中提取函数依赖,以推断候选码和属性。
  • 将发现的依赖关系规范化,以生成3NF模式。
  • 对最终模式进行规范化和依赖保持性验证。

实验结果

研究问题

  • RQ1关联规则挖掘能否有效从遗留数据库实例中恢复出规范化概念模式?
  • RQ2在逆向工程过程中,如何缓解关联规则的指数级增长问题?
  • RQ3在缺乏先前文档的情况下,所提出方法在多大程度上能生成符合3NF的模式?
  • RQ4规则过滤启发式方法在提升可扩展性和降低噪声方面的有效性如何?
  • RQ5该方法能否在最小人工干预下应用于现实世界的企业数据库?

主要发现

  • 所提出方法成功地从无先前文档的数据库实例中重建了符合3NF的概念模式。
  • 规则过滤启发式方法显著减少了候选规则数量,提升了计算效率。
  • 该方法在从真实数据中恢复有意义的函数依赖方面表现出可行性。
  • 所生成的模式保持了商业应用中常用的规范化原则。
  • 当文档缺失时,该方法为遗留数据库维护提供了实用的替代方案。
  • 通过在真实世界数据库实例上的应用,该技术得到验证,显示出一致的模式恢复效果。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。