[论文解读] Selective Inference for Hierarchical Clustering
本文提出了一种选择性推断框架,用于检验通过层次聚类形成的聚类之间均值差异,同时考虑了基于数据的假设选择。通过条件化于聚类结果并使用截断卡方分布计算精确p值,该方法控制了选择性第一类错误率——在使用相同数据估计聚类的同时进行检验时,确保了推断的有效性。
Classical tests for a difference in means control the type I error rate when the groups are defined a priori. However, when the groups are instead defined via clustering, then applying a classical test yields an extremely inflated type I error rate. Notably, this problem persists even if two separate and independent data sets are used to define the groups and to test for a difference in their means. To address this problem, in this paper, we propose a selective inference approach to test for a difference in means between two clusters. Our procedure controls the selective type I error rate by accounting for the fact that the choice of null hypothesis was made based on the data. We describe how to efficiently compute exact p-values for clusters obtained using agglomerative hierarchical clustering with many commonly-used linkages. We apply our method to simulated data and to single-cell RNA-sequencing data.
研究动机与目标
- 解决在使用相同数据进行聚类的同时测试聚集群均值差异时出现的类型I错误率膨胀问题。
- 开发一种统计框架,以考虑原假设是基于数据选择的事实,从而违反经典推断假设。
- 为使用常见链接方式的凝聚层次聚类提供均值差异检验的精确p值。
- 确保在高维设置(如单细胞RNA测序数据)中的有效推断,此类场景中基于聚类的检验非常普遍。
提出的方法
- 该方法使用选择性推断,通过条件化于观测到的聚类结果来计算精确p值,将聚类分配视为一种随机选择机制。
- 将检验统计量(聚集群均值之差)建模为截断卡方分布,截断区域由观测到的聚类结构定义。
- p值计算为在原假设下,检验统计量超过观测值的概率,条件于所选聚类结果被选中的情况。
- 该方法适用于使用单链接、平均链接、完全链接和质心链接的凝聚层次聚类,利用条件分布的闭式表达式。
- 该方法考虑了聚类是从数据中估计的事实,从而校正了假设检验中的选择偏差。
- 推导了在原假设下检验统计量的选择性抽样分布,使得即使在使用相同数据进行聚类和检验时,也能实现有效推断。
实验结果
研究问题
- RQ1当聚类是基于用于测试的相同数据估计时,我们能否开发一种关于聚集群均值差异的有效的假设检验?
- RQ2基于数据的聚类选择如何影响经典t检验或Wald检验中的第一类错误率?
- RQ3当原假设是基于数据选择时,检验统计量的正确抽样分布是什么?
- RQ4我们能否计算出控制选择性第一类错误率的精确p值,以应用于层次聚类?
- RQ5所提出方法的统计功效如何随效应大小、聚集群大小和链接类型而变化?
主要发现
- 所提出的方法通过条件化于聚类结果来控制选择性第一类错误率,避免了经典Wald检验中观察到的严重膨胀。
- 在聚类后应用经典检验会得到高度反保守的p值,即使在使用独立的训练集和测试集时,第一类错误率也远超名义水平。
- 样本分割无法解决该问题,因为测试集的分配仍然依赖于数据驱动的聚类选择,从而破坏了标准推断的有效性。
- 该方法在所有测试的链接方式(单链接、平均链接、完全链接、质心链接)下均实现了有效推断,当原假设为真时,p值在原假设下均匀分布。
- 统计功效随效应大小Δ增加而提高,即使在小聚集群中,该方法仍保持足够的功效,但当min{|C₁|, |C₂|} < 10时,功效下降。
- 当检验统计量接近选择区域边界时,p值增大,这反映了推断的条件性,与选择性推断理论一致。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。