[论文解读] An adaptable generalization of Hotelling's $T^2$ test in high dimension
本文提出了一种自适应岭正则化Hotelling's $T^2$检验(ARHT),用于高维两样本均值比较,其中正则化参数为数据驱动,并选择为在局部替代假设下最大化检验效能。该方法在子高斯分布假设下展现出优异的有限样本性能和渐近有效性,且通过随机过程的弱收敛性,实现了临界值的精确计算。
We propose a two-sample test for detecting the difference between mean vectors in a high-dimensional regime based on a ridge-regularized Hotelling's $T^2$. To choose the regularization parameter, a method is derived that aims at maximizing power within a class of local alternatives. We also propose a composite test that combines the optimal tests corresponding to a specific collection of local alternatives. Weak convergence of the stochastic process corresponding to the ridge-regularized Hotelling's $T^2$ is established and used to derive the cut-off values of the proposed test. Large sample properties are verified for a class of sub-Gaussian distributions. Through an extensive simulation study, the composite test is shown to compare favorably against a host of existing two-sample test procedure in a wide range of settings. The performance of the proposed test procedure is illustrated through an application to a breast cancer data set where the goal is to detect the pathways with different DNA copy number alterations across breast cancer subtypes.
研究动机与目标
- 解决当维度 $p$ 与样本量 $n$ 相当或更大时,经典Hotelling's $T^2$检验的不一致性问题。
- 克服现有高维检验方法在假设稀疏性或依赖强分布假设方面的局限性。
- 提出一种数据自适应的正则化参数选择方法,以在不依赖总体协方差矩阵知识的前提下,最大化局部替代假设下的检验效能。
- 构建一个组合检验,整合多个岭正则化统计量,以增强在不同均值与协方差结构下的稳健性。
- 建立正则化检验统计量所依赖的随机过程的弱收敛性,以实现临界值的精确推导。
提出的方法
- 提出一种岭正则化Hotelling's $T^2$(RHT)检验统计量,以在高维情形下稳定样本协方差矩阵的逆矩阵。
- 推导一种数据驱动的正则化参数 $\lambda$ 选择方法,通过在基于均值差异 $\mu$ 先验定义的一类局部替代假设下最大化检验效能来实现。
- 提出一种组合检验(ARHT),将多个最优选择的 $\lambda$ 值下的RHT统计量组合起来,以适应未知的均值与协方差结构。
- 建立在紧致区间 $C \subset \mathbb{R}_+$ 上,归一化的随机过程 $\mathrm{RHT}(\lambda)$ 的弱收敛性,其极限为高斯分布,从而实现临界值的推导。
- 利用随机矩阵理论与集中不等式,在子高斯假设下推导渐近性质,从而放宽对高斯性的要求。
- 采用单调变换或 $\chi^2$ 近似以改善检验统计量的有限样本表现。
实验结果
研究问题
- RQ1在高维情形下,如何选择岭正则化Hotelling's $T^2$检验中的正则化参数,以在局部替代假设下最大化统计效能?
- RQ2能否通过组合多个岭正则化统计量来构建一个组合检验,使其在高维两样本检验中对各种均值与协方差结构均表现出稳健性能?
- RQ3在子高斯假设下,岭正则化Hotelling's $T^2$统计量的渐近分布为何?如何利用该分布推导出精确的临界值?
- RQ4在广泛的模拟场景下,所提出的ARHT检验与现有高维两样本检验相比,在效能与大小准确性方面表现如何?
- RQ5当真实均值差异结构或 $\Sigma$ 的特征值衰减模式未知时,$\lambda$ 的数据驱动选择在多大程度上提升了检验性能?
主要发现
- 所提出的ARHT检验在广泛的模拟设置下均展现出优越的检验效能,包括密集与稀疏的均值差异、$\Sigma$ 的多种特征值衰减模式以及子高斯数据。
- 基于局部效能最大化的数据驱动正则化参数 $\lambda$ 选择方法,显著优于固定值或交叉验证选择的策略,大幅提升了检验性能。
- 已建立随机过程 $\mathrm{RHT}(\lambda)$ 的弱收敛性,其极限为高斯分布,从而可精确计算组合ARHT检验的临界值。
- 即使在 $p \gg n$ 的情况下,该方法仍保持良好的大小控制与检验效能,且在多数场景下优于Bai & Saranadasa(1996)和Srivastava & Du(2008)等现有检验方法。
- 对检验统计量进行简单的单调变换或采用 $\chi^2$ 近似,可显著改善其有限样本行为,增强经验大小控制能力。
- ARHT检验在特定先验条件下,可视为Bai & Saranadasa(1996)检验的极限推广,从而将经典与现代高维方法联系起来。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。