Skip to main content
QUICK REVIEW

[논문 리뷰] A Sieve Quasi-likelihood Ratio Test for Neural Networks with Applications to Genetic Association Studies

Xiaoxi Shen, Chang Jiang|arXiv (Cornell University)|2022. 12. 16.
Statistical Methods and Inference인용 수 4
한 줄 요약

이 논문은 단일 은닉층을 가진 신경망을 위한 필터 준우도비율(SQLR) 검정을 제안하여 비모수 회귀 설정에서 가설 검정을 가능하게 한다. 검정 통계량은 渐近적으로 카이제곱 분포를 따르며, 데이터 분할 없이 계산적으로 효율적이고 실행 가능한 추론이 가능하다. 시뮬레이션을 통해 검증되었고, 알츠하이머병 데이터에서 유전자 연관 분석에 적용되었다.

ABSTRACT

Neural networks (NN) play a central role in modern Artificial intelligence (AI) technology and has been successfully used in areas such as natural language processing and image recognition. While majority of NN applications focus on prediction and classification, there are increasing interests in studying statistical inference of neural networks. The study of NN statistical inference can enhance our understanding of NN statistical proprieties. Moreover, it can facilitate the NN-based hypothesis testing that can be applied to hypothesis-driven clinical and biomedical research. In this paper, we propose a sieve quasi-likelihood ratio test based on NN with one hidden layer for testing complex associations. The test statistic has asymptotic chi-squared distribution, and therefore it is computationally efficient and easy for implementation in real data analysis. The validity of the asymptotic distribution is investigated via simulations. Finally, we demonstrate the use of the proposed test by performing a genetic association analysis of the sequencing data from Alzheimer's Disease Neuroimaging Initiative (ADNI).

연구 동기 및 목표

  • 생물의학 연구에서 추론을 지원하는 통계적으로 타당한 신경망용 가설 검정을 개발하는 것.
  • 와드 및 우도비율 검정과 같은 전통적 검정을 무효화하는 신경망에서의 매개변수 식별 불가 문제를 해결하는 것.
  • 기존의 적합도 검정에서 요구되는 데이터 분할을 피함으로써 통계적 검정력을 유지하는 것.
  • 실제 데이터 분석에 실용적으로 적용 가능한 단순한 渐近 분포(카이제곱)를 가진 검정을 수립하는 것.
  • 알츠하이머병 신경영상연구기구(ADNI)에서 확보한 시퀀싱 데이터를 활용한 유전자 연관 연구에 방법을 적용하는 것.

제안 방법

  • 랜덤 설계 하에서 비모수 회귀에 기반한 단일 은닉층 신경망을 활용한 필터 준우도비율(SQLR) 검정을 제안한다.
  • 유한차원 함수 공간의 수열을 통해 진짜 회귀 함수의 서류 근사법을 사용한다.
  • 검정 통계량을 귀무가설과 대립가설 하에서의 준우도비율의 비율로 정의하며, 영향 함수와 경험과정 이론을 활용한다.
  • 함수 클래스의 모멘트 및 엔트로피 조건을 포함한 규칙성 조건 하에서 검정 통계량의 渐近 카이제곱 분포를 확립한다.
  • 델타 방법과 도네스커 클래스 이론을 활용해 경험과정의 수렴 속도 및 渐近 정규성을 유도한다.
  • 맥디아미드 부등식을 활용해 경험과정의 편차를 제어함으로써, 약한 모멘트 가정 하에서도 검정의 일致성을 확보한다.

실험 결과

연구 질문

  • RQ1가설 검정을 위한 단순한 渐近 분포를 가지는 신경망 기반 검정을 구성할 수 있는가?
  • RQ2제안된 SQLR 검정은 통계적 검정력을 유지하면서도 데이터 분할이 필요 없는가?
  • RQ3실제 신경망 모델의 규칙성 조건 하에서 SQLR 검정의 渐近 카이제곱 분포가 타당한가?
  • RQ4SQLR 검정은 고차원 유전자 데이터에서 복잡한 비선형 연관성을 탐지할 수 있는가?
  • RQ5유한 표본에서 기존의 신경망 기반 추론 방법과 비교해 SQLR 검정은 어떤 성능을 보이는가?

주요 결과

  • 제안된 필터 준우도비율 검정 통계량은 渐近적으로 카이제곱 분포를 따르며, 간편한 임계값 결정이 가능하다.
  • 검정은 데이터 분할이 필요 없어, 기존의 적합도 검정과 비교해 잠재적인 검정력 손실을 방지한다.
  • 시뮬레이션 결과는 귀무가설 하에서의 渐近 카이제곱 분포 타당성이 확인되었다.
  • 이 방법은 수렴 속도 $ \|\hat{f}_{n}-f_{0}\| = \mathcal{O}_{p}\left((n/\log n)^{-(1+1/d)/(4(1+1/(2d)))}\right) $ 를 달성하여, 전통적인 비모수 방법보다 향상된 성능을 보였다.
  • ADNI 유전자 연관 연구에서 SQLR 검정은 유전자 변이와 알츠하이머병 진행 간의 유의미한 비선형 연관성을 성공적으로 탐지하였다.
  • 약한 모멘트 조건 하에서도 검정이 강인하며, 진짜 함수가 서류 공간에 정확히 표현되지 않더라도 검정의 타당성이 유지된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.