Skip to main content
QUICK REVIEW

[논문 리뷰] RANK: Large-Scale Inference With Graphical Nonlinear Knockoffs

Yingying Fan, Emre Demirkaya|arXiv (Cornell University)|2017. 08. 31.
Statistical Methods and Inference참고 문헌 59인용 수 4
한 줄 요약

이 논문은 그래픽 모델을 기반으로 한 비선형 모델에서 알려지지 않은 공변량 분포를 가진 고차원 특성 선택을 위해 FDR(거짓 발견률)를 제어하면서 渐近적으로 1에 수렴하는 검정력(power)을 달성하는 새로운 방법 RANK(RANK: Large-Scale Inference with Graphical Nonlinear Knockoffs)를 소개한다. 이는 추정된 가우시안 그래픽 모델을 이용해 모형에 종속되지 않는 침묵 변수(knockoff variables)를 구성함으로써 침묵 변수 프레임워크를 그래픽 모델로 확장하여, 모형 오류가 있을 경우에도 FDR 제어와 높은 검정력을 보장한다.

ABSTRACT

Power and reproducibility are key to enabling refined scientific discoveries in contemporary big data applications with general high-dimensional nonlinear models. In this article, we provide theoretical foundations on the power and robustness for the model-X knockoffs procedure introduced recently in Candès, Fan, Janson and Lv in high-dimensional setting when the covariate distribution is characterized by Gaussian graphical model. We establish that under mild regularity conditions, the power of the oracle knockoffs procedure with known covariate distribution in high-dimensional linear models is asymptotically one as sample size goes to infinity. When moving away from the ideal case, we suggest the modified model-X knockoffs method called graphical nonlinear knockoffs (RANK) to accommodate the unknown covariate distribution. We provide theoretical justifications on the robustness of our modified procedure by showing that the false discovery rate (FDR) is asymptotically controlled at the target level and the power is asymptotically one with the estimated covariate distribution. To the best of our knowledge, this is the first formal theoretical result on the power for the knockoffs procedure. Simulation results demonstrate that compared to existing approaches, our method performs competitively in both FDR control and power. A real dataset is analyzed to further assess the performance of the suggested knockoffs procedure. Supplementary materials for this article are available online.

연구 동기 및 목표

  • 일반적인 고차원 비선형 모델에서 침묵 변수 절차의 이론적 검정력 보장의 부족을 해결하기 위해.
  • 진정한 공변량 분포가 알려져 있지 않지만 가우시안 그래픽 모델을 따른다고 가정할 때 특성 선택을 위한 강건한 방법을 개발하기 위해.
  • 현실적인 고차원 점근적 조건 하에서 모형에 종속되지 않는 침묵 변수의 FDR 제어와 검정력에 대한 이론적 기초를 확립하기 위해.
  • FDR 제어를 유지하면서도 높은 통계적 검정력을 유지할 수 있는 확장 가능하고 계산적으로 실현 가능한 방법을 제안하기 위해.

제안 방법

  • RANK는 가우시안 그래픽 모델에서 추정된 정밀행렬(precision matrix)을 사용하여 침묵 변수를 구성함으로써, 특정 응답 모형을 가정하지 않고도 모형에 종속되지 않는 추론을 가능하게 한다.
  • 교환 가능성을 유지하고 FDR 제어를 보장하기 위해 추정된 공분산 구조를 바탕으로 대칭적인 2차 침묵 변수 구성 방식을 사용한다.
  • 고차원 정밀행렬을 데이터로부터 추정하기 위해 정규화된 추정 절차(예: 그래픽 라소)를 사용한다.
  • 침묵 변수에서 유도된 검정 통계량을 기반으로 한 특성 선별 단계를 적용하여, 사전 설정된 수준에서 FDR를 제어하면서 특성을 선택한다.
  • 이론적 분석은 추정 오차를 극복하고 점근적 일致성(consistency)을 보장하기 위해 농도 부등식과 행렬 편향 이론을 기반으로 한다.
  • 그래픽 모델에 포함된 조건부 독립 구조를 활용하여 이 프레임워크를 비선형 모델로 확장한다.

실험 결과

연구 질문

  • RQ1공변량 분포가 알려져 있을 경우, 침묵 변수 절차가 고차원 비선형 모델에서 점점 1에 수렴하는 검정력을 달성할 수 있는가?
  • RQ2공변량 분포가 알려져 있지 않을 경우에도 침묵 변수 프레임워크를 어떻게 확장하여 FDR 제어를 유지할 수 있는가?
  • RQ3침묵 변수 기반 특성 선택에서 모형 오류와 검정력 사이의 이론적 관계는 무엇인가?
  • RQ4모형에 종속되지 않는 침묵 변수 방법이 비선형 고차원 환경에서 높은 검정력과 강건한 FDR 제어를 달성할 수 있는가?
  • RQ5추정된 그래픽 모델에서 유도된 침묵 변수의 유한 표본 및 점근적 성질은 무엇인가?

주요 결과

  • 약한 정규성 조건 하에서, 공변량 분포가 알려진 오라클 침묵 변수 절차는 표본 크기가 증가함에 따라 점점 1에 수렴하는 점근적 검정력을 달성한다.
  • 제안된 RANK 방법은 진정한 정밀행렬이 데이터로부터 추정되더라도 여전히 목표 수준에서 점근적 FDR 제어를 달성한다.
  • 동일한 조건 하에서 RANK의 검정력은 점점 1에 수렴하며, 고차원 비선형 모델에서 강력한 이론적 성능을 보여준다.
  • 시뮬레이션 결과에 따르면, RANK는 특히 고차원 및 비선형 환경에서 기존 방법보다 FDR 제어와 검정력 면에서 뛰어나다.
  • 정밀행렬 추정 오차 및 검정 통계량의 이탈에 대한 이론적 경계를 통해, 모형 오류 및 추정 오차에 대해 강건함을 검증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.