Skip to main content
QUICK REVIEW

[논문 리뷰] Control of the False Discovery Rate Under Arbitrary Covariance Dependence

Xu Han, Weijie Gu|arXiv (Cornell University)|2010. 12. 20.
Statistical Methods in Clinical Trials참고 문헌 25인용 수 15
한 줄 요약

이 논문은 고차원 다중검정에서 임의의 종속 구조 하에서 잘못 발견 비율(FDR)을 제어하기 위해 주성분 요인 근사(Principal Factor Approximation, PFA) 방법을 제안한다. 이는 공분산 행렬의 스펙트럼 분해를 통해 강한 공통 요인을 제거함으로써 이루어지며, 이로 인해 잘못 발견 비율(FDP)의 일致한 추정이 가능해지고, 상관관계가 있는 검정 통계량 하에서 Efron의 방법보다 뛰어난 성능을 보인다.

ABSTRACT

Multiple hypothesis testing is a fundamental problem in high dimensional inference, with wide applications in many scientific fields. In genome-wide association studies, tens of thousands of tests are performed simultaneously to find if any genes are associated with some traits and those tests are correlated. When test statistics are correlated, false discovery control becomes very challenging under arbitrary dependence. In the current paper, we propose a new methodology based on principal factor approximation, which successfully substracts the common dependence and weakens significantly the correlation structure, to deal with an arbitrary dependence structure. We derive the theoretical distribution for false discovery proportion (FDP) in large scale multiple testing when a common threshold is used and provide a consistent FDP. This result has important applications in controlling FDR and FDP. Our estimate of FDP compares favorably with Efron (2007)'s approach, as demonstrated by in the simulated examples. Our approach is further illustrated by some real data applications.

연구 동기 및 목표

  • 검정 통계량이 임의의 종속성을 띠는 상황에서 FDR를 제어하는 데 도전하는 문제를 다루기 위해.
  • 독립성 또는 특정 종속 구조를 가정하는 대신 공분산 정보를 완전히 통합하는 방법을 개발하기 위해.
  • 일般적인 종속성 하에서 잘못 발견 비율(FDP)의 일致한 추정기법을 도출하여 신뢰할 수 있는 FDR 제어를 가능하게 하기 위해.
  • 높은 상관관계 하에서 정확도를 잃는 기존의 FDR 절차(예: Benjamini-Hochberg 및 Storey의 방법)를 향상시키기 위해.
  • 유전체 연관 분석(GWAS)과 같은 실제 문제에 적용 가능한 이론적으로 탄탄하고 확장 가능한 해결책을 제공하기 위해.

제안 방법

  • 알려진 공분산 행렬 $\Sigma$의 스펙트럼 분해를 통해 검정 통계량 간 강한 종속성을 유발하는 주성분 요인을 추출한다.
  • 주성분 요인 근사(PFA)를 적용하여 지배적인 공통 요인을 제거함으로써 전체 종속성 구조를 약화시킨다.
  • 요인 제거 후 잔류하는 약한 종속성을 고려하여, 큰 $p$ 하에서 잘못 발견 비율(FDP)의 점근적 분포를 유도한다.
  • 임계값 기반 절차를 사용하며, $\widehat{\text{FDR}}(t) = \widehat{p}_0 t / (R(t) \vee 1)$로 정의되며, $\widehat{\text{FDR}}(t) \leq \alpha$ 를 만족하는 $t$ 를 구한다. $\widehat{p}_0$ 는 데이터로부터 추정된다.
  • 정규 누적분포함수 $\Phi$ 와 표준정규밀도함수 $\phi$ 를 사용하여 FDP 추정에서 꼬리 확률을 모델링하며, 추정된 요인 하중과 가중치를 통합한다.
  • 코시-슈바르츠 부등식과 농도 경계를 적용하여, 고유값과 요인 하중에 대한 규칙성 조건 하에서 FDP 추정기의 점근적 일관성을 확립한다.

실험 결과

연구 질문

  • RQ1검정 통계량이 고도로 상관관계가 있거나 임의의 종속성 구조를 띠는 경우에도 FDR을 일관되게 제어할 수 있는가?
  • RQ2고차원 데이터에서 공통 종속성 구조를 효과적으로 제거하여 FDR 추정을 향상시킬 수 있는가?
  • RQ3일般적인 종속성 하에서 잘못 발견 비율(FDP)의 이론적 분포는 무엇이며, 이를 일관되게 추정할 수 있는가?
  • RQ4상관관계가 있는 검정 통계량 하에서 제안된 PFA 방법은 Efron(2007)의 경험베이지안 접근법보다 성능이 뛰어나게 되는가?
  • RQ5유전체 연관 분석(GWAS)과 같은 실제 응용에서 이 방법은 파워와 정확성을 어느 정도 유지하는가?

주요 결과

  • 제안된 PFA 방법은 공분산 행렬이 비트리비얼한 경우에도 임의의 종속성 하에서 잘못 발견 비율(FDP)의 일관된 추정을 달성한다.
  • 이론적 분석 결과, 유계 고유값과 요인 하중 등의 규칙성 조건 하에서 FDP 추정기는 확률적으로 진짜 FDP로 수렴함을 보였다.
  • 모의 실험에서 Efron(2007)의 접근법보다 뛰어난 성능을 보였으며, 특히 FDR 제어가 가장 취약해지는 고상관관계 설정에서 두드러졌다.
  • 적절한 모멘트 조건 하에서 FDP 추정기는 $O_p(\sqrt{k/m})$-일관성을 보임을 입증하였다. 여기서 $k$ 는 요인 수, $m$ 은 표본 크기이다.
  • 모의 실험과 실제 데이터 응용 모두에서 검정 통계량이 고도로 상관관계가 있을 때도 명목 수준 $\alpha$ 에서 FDR 제어를 유지함을 입증하였다.
  • 이 방법은 GWAS와 같이 수만 개의 영향을 동시에 검정하는 복잡한 종속성 구조를 가진 대규모 문제에 적용 가능하며 확장성이 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.