[论文解读] A Sieve Quasi-likelihood Ratio Test for Neural Networks with Applications to Genetic Association Studies
本文提出了一种用于单隐藏层神经网络的筛子似然比(SQLR)检验,以在非参数回归设置中实现假设检验。该检验的检验量渐近服从卡方分布,从而实现计算高效且可实施的推断,无需数据分割,经模拟验证并应用于阿尔茨海默病数据的遗传关联分析。
Neural networks (NN) play a central role in modern Artificial intelligence (AI) technology and has been successfully used in areas such as natural language processing and image recognition. While majority of NN applications focus on prediction and classification, there are increasing interests in studying statistical inference of neural networks. The study of NN statistical inference can enhance our understanding of NN statistical proprieties. Moreover, it can facilitate the NN-based hypothesis testing that can be applied to hypothesis-driven clinical and biomedical research. In this paper, we propose a sieve quasi-likelihood ratio test based on NN with one hidden layer for testing complex associations. The test statistic has asymptotic chi-squared distribution, and therefore it is computationally efficient and easy for implementation in real data analysis. The validity of the asymptotic distribution is investigated via simulations. Finally, we demonstrate the use of the proposed test by performing a genetic association analysis of the sequencing data from Alzheimer's Disease Neuroimaging Initiative (ADNI).
研究动机与目标
- 开发一种在生物医学研究中支持推断的神经网络统计假设检验方法。
- 解决神经网络中参数不可识别的问题,该问题使经典的Wald检验和似然比检验失效。
- 避免现有拟合优度检验中所需的数据分割,从而保留统计功效。
- 建立一种具有简单渐近分布(卡方分布)的检验,以实现真实世界数据分析中的实际应用。
- 将该方法应用于阿尔茨海默病神经影像计划(ADNI)提供的测序数据进行遗传关联研究。
提出的方法
- 基于随机设计下的非参数回归,提出一种基于神经网络的筛子似然比(SQLR)检验。
- 通过一系列有限维函数空间对真实回归函数进行筛子逼近。
- 将检验统计量定义为原假设与备择假设下拟似然之比,利用影响函数和经验过程理论。
- 在满足正则性条件(包括函数类的矩条件和熵条件)下,建立检验统计量的渐近卡方分布。
- 应用delta方法和Donsker类理论,推导经验过程的收敛速度和渐近正态性。
- 采用McDiarmid不等式控制经验过程偏差,确保在弱矩假设下检验的一致性。
实验结果
研究问题
- RQ1能否构建一种基于神经网络的检验,使其具有用于假设检验的简单渐近分布?
- RQ2所提出的SQLR检验是否可在不进行数据分割的情况下维持统计功效?
- RQ3在神经网络模型的现实正则性条件下,SQLR检验的渐近卡方分布是否有效?
- RQ4SQLR检验能否检测高维遗传数据中的复杂非线性关联?
- RQ5在有限样本中,SQLR检验相较于现有基于神经网络的推断方法表现如何?
主要发现
- 所提出的筛子似然比检验统计量渐近服从卡方分布,从而可简便确定临界值。
- 该检验无需数据分割,避免了与现有拟合优度检验相比可能存在的功效损失。
- 模拟结果证实,在原假设下渐近卡方分布具有有效性。
- 该方法实现了 $ \|\hat{f}_{n}-f_{0}\| = \mathcal{O}_{p}\left((n/\log n)^{-(1+1/d)/(4(1+1/(2d)))}\right) $ 的收敛速度,表明其性能优于经典非参数方法。
- 在ADNI遗传关联研究中,SQLR检验成功识别出遗传变异与阿尔茨海默病进展之间的显著非线性关联。
- 该检验在弱矩条件下具有稳健性,即使真实函数在筛子空间中不能精确表示,其有效性仍得以保持。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。