[论文解读] A Permutation Approach to Testing Interactions in Many Dimensions
本文提出一种基于排列的检测高维二值响应数据中边际交互作用的方法,通过建模给定类别的协变量条件分布(反向模型),避免依赖渐近近似和逻辑回归假设。与标准成对逻辑回归相比,该方法在存在主效应时,错误发现率更低,检测真实交互作用的统计功效更高,且在温和条件下具有理论一致性。
To date, testing interactions in high dimensions has been a challenging task. Existing methods often have issues with sensitivity to modeling assumptions and heavily asymptotic nominal p-values. To help alleviate these issues, we propose a permutation-based method for testing marginal interactions with a binary response. Our method searches for pairwise correlations which differ between classes. In this manuscript, we compare our method on real and simulated data to the standard approach of running many pairwise logistic models. On simulated data our method finds more significant interactions at a lower false discovery rate (especially in the presence of main effects). On real genomic data, although there is no gold standard, our method finds apparent signal and tells a believable story, while logistic regression does not. We also give asymptotic consistency results under not too restrictive assumptions.
研究动机与目标
- 为解决标准逻辑回归在高维设置下检验边际交互作用时的局限性,特别是模型依赖性和渐近p值近似的问题。
- 开发一种更稳健、更少依赖模型的方法,用于检测高维二值结果数据中协变量之间的交互作用。
- 利用基于排列的零分布实现准确的错误发现率(FDR)估计,避免依赖最大似然估计的渐近正态性。
- 在温和正则性条件下,提供一种理论一致的交互作用检验框架,即使在 $ n < p $ 的情况下也成立。
- 在模拟数据和真实基因组数据上,证明该方法相较于标准逻辑回归方法具有更优性能。
提出的方法
- 提出一种反向模型框架,建模 $ X|Y $ 而非 $ Y|X $,以检验两类间成对相关性的差异。
- 通过类别标签的排列生成成对相关性差异的零分布,实现非渐近的FDR估计。
- 对每对协变量 $ (j,k) $,计算类别1与类别2之间样本相关性的差异,再通过类别标签的排列生成零参考分布。
- 采用基于类间相关性绝对差异的检验统计量,p值由排列分布得出。
- 对排列生成的p值应用Benjamini-Hochberg程序,以控制错误发现率(FDR)。
- 在次高斯性和 $ \log p / n \to 0 $ 条件下建立理论一致性,证明当 $ n \to \infty $ 时,FDR估计收敛于零。
实验结果
研究问题
- RQ1基于排列的方法是否能在错误发现率更低的前提下,优于标准成对逻辑回归,以检测高维交互作用?
- RQ2在高维交互作用检验中,反向建模方法(条件于 $ X|Y $)是否比正向建模(条件于 $ Y|X $)提供更稳健且更强大的推断?
- RQ3在高维逻辑模型中,基于排列的p值是否能比渐近p值提供更可靠的FDR控制?
- RQ4当存在强主效应时,该方法表现如何?主效应常会混淆标准交互作用检验。
- RQ5在何种正则性条件下,随着维度增加,基于排列的FDR估计器仍能保持一致性?
主要发现
- 在模拟数据中,所提方法在存在主效应时,以更低的错误发现率检测到更多的真实交互作用,优于成对逻辑回归。
- 在真实基因组数据中,该方法识别出逻辑回归未能检测到的具有生物学合理性的交互信号,表明其敏感性更高。
- 基于排列的FDR估计比渐近p值更可靠,后者在模型误设或预测变量间存在相关性时呈现反保守性。
- 该方法具有渐近一致性:在次高斯性和 $ \log p / n \to 0 $ 条件下,随着样本量增加,估计的FDR收敛于零。
- 理论分析表明,基于排列的检验统计量在原假设下依概率收敛于真实的相关性差异,确保了有效的误差控制。
- 即使当 $ n < p(p+1)/2 $ 时,该方法仍保持有效性,避免了完整逻辑模型中出现的完全分离和不可识别性问题。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。