Skip to main content
QUICK REVIEW

[论文解读] Multiple Hypothesis Testing in Pattern Discovery

Sami Hanhijärvi, Kai Puolamäki|ArXiv.org|Jun 29, 2009
Data Mining Algorithms and Applications参考文献 12被引用 6
一句话总结

本文提出了一种通用的、非参数化方法,用于在模式发现的多重假设检验中控制家族错误率(FWER),采用基于随机化的p值估计和Holm-Bonferroni校正。该方法通过仅要求满足minP性质,将显著性检验扩展至任意数据挖掘算法,并在合成数据和真实世界数据(包括频繁子图挖掘)上实证验证了其在高统计效能下对FWER的有效控制。

ABSTRACT

The problem of multiple hypothesis testing arises when there are more than one hypothesis to be tested simultaneously for statistical significance. This is a very common situation in many data mining applications. For instance, assessing simultaneously the significance of all frequent itemsets of a single dataset entails a host of hypothesis, one for each itemset. A multiple hypothesis testing method is needed to control the number of false positives (Type I error). Our contribution in this paper is to extend the multiple hypothesis framework to be used with a generic data mining algorithm. We provide a method that provably controls the family-wise error rate (FWER, the probability of at least one false positive) in the strong sense. We evaluate the performance of our solution on both real and generated data. The results show that our method controls the FWER while maintaining the power of the test.

研究动机与目标

  • 为解决数据挖掘中同时测试数千个模式所导致的I类错误率膨胀问题,即多重假设检验的挑战。
  • 开发一种通用框架,适用于任何数据挖掘算法,且无需对数据分布或模式依赖性做假设。
  • 在保持统计效能的同时,强控制家族错误率(FWER),避免过度产生假阴性结果。
  • 在多种数据类型(包括事务型数据和图结构数据)上验证该方法,证明其在不同领域中的鲁棒性。

提出的方法

  • 该方法利用随机化生成从模式中导出的检验统计量的零分布,从而在原假设下实现p值估计。
  • 要求数据挖掘算法满足minP性质,以确保一组假设中最小的p值在随机意义下也是最小的。
  • 对随机化后的p值应用Holm-Bonferroni程序,以强意义下控制FWER,采用逐步下降的方式调整p值。
  • 对于每个模式,p值计算为在随机化数据集中检验统计量超过原始数据统计量的比例。
  • 该框架应用于频繁项集和子图挖掘,采用保持图中节点度数不变的边交换随机化方法。
  • 该方法具有通用性,不假设模式之间独立或具有特定结构,因此适用于复杂的数据挖掘任务。

实验结果

研究问题

  • RQ1是否存在一种通用的、非参数化方法,可在任意数据挖掘算法的多重假设检验中控制家族错误率(FWER)?
  • RQ2所提出的方法是否在控制FWER的同时保持高统计效能,特别是在高维模式空间中?
  • RQ3minP性质是否是真实世界数据挖掘算法中实际且可行的假设?
  • RQ4该方法是否能有效应用于复杂数据类型(如图结构数据),其中数据划分或独立性假设不成立?

主要发现

  • 所提出的方法在所有测试数据集(包括真实和合成数据)上均成功将家族错误率(FWER)控制在期望的显著性水平α以内。
  • 在复合图数据集上,最小支持度为40时,原始数据中发现了140个频繁子图,而随机数据中的期望数量为191.8(标准差13.4),表明该方法能正确识别非随机模式。
  • 所有实验中均满足minP性质,证实了p值估计的有效性以及FWER控制的正确性。
  • 该方法保持了高统计效能,表现为在不同α水平下发现的显著模式数量,图8的结果显示了稳定的检测性能。
  • 该框架对复杂数据结构具有鲁棒性,通过采用保持节点度数不变的边交换随机化方法,成功应用于图结构数据。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。