Skip to main content
QUICK REVIEW

[논문 리뷰] False discovery rate control for identifying simultaneous signals

Sihai Dave Zhao|arXiv (Cornell University)|2015. 12. 14.
Genetic Mapping and Diversity in Plants and Animals참고 문헌 52인용 수 3
한 줄 요약

이 논문은 가짜 발현률(FDR)을 증명 가능하게 제어하면서 두 개 이상의 독립된 연구에서 동시에 유의미한 특징(동시 신호)을 식별하기 위한 조정 파rameter가 없고 비모수적(procedure)인 방법을 제안한다. 이 방법은 귀무분포나 대립분포에 대한 지식이 필요로 하지 않으며, 시뮬레이션과 정신질환 GWAS 분 析에서 기존 방법보다 높은 검정력과 더 나은 오류 제어 성능을 보인다.

ABSTRACT

It is frequently of interest to jointly analyze multiple sequences of multiple tests in order to identify simultaneous signals, defined as features tested in two or more independent studies that are significant in each. For example, researchers often wish to discover genetic variants that are significantly associated with multiple traits. This paper proposes a false discovery rate control procedure for identifying simultaneous signals in two studies. A pair of test statistics is available for each feature, and the goal is to identify features for which both are non-null. Error control is difficult due to the composite nature of a non-discovery, as one of the tests in the pair can still be non-null. Very few existing methods have high power while still provably controlling the false discovery rate. This paper proposes a simple, fast, tuning parameter-free nonparametric procedure that can be shown to provide asymptotically conservative false discovery rate control. Surprisingly, the procedure does not require knowledge of either the null or the alternative distributions of the test statistics. In simulations, the proposed method had higher power and better error control than existing procedures. In an analysis of genome-wide association study results from five psychiatric disorders, it identified more pairs of disorders that share simultaneously significant genetic variants, as well as more variants themselves, compared to other methods. The proposed method is available in the R package ssa.

연구 동기 및 목표

  • 다양한 독립된 연구에서 유의미한 특징을 식별하면서도 가짜 발현률(FDR)을 제어하는 문제를 해결하기 위해.
  • 한 쌍의 검정에서 하나의 검정이 여전히 비귀무일 수 있는 복합적인 비발견(non-discovery)의 성격에도 불구하고 강력한 오류 제어를 유지하는 방법을 개발하기 위해.
  • 계산이 빠르고, 조정 파rameter가 없으며, 검정 통계량의 귀무분포나 대립분포에 대한 지식이 필요 없는 절차를 만들기 위해.
  • 기존의 FDR 제어 방법보다 동시에 신호를 탐지하는 데 있어 통계적 검정력을 향상시키기 위해.
  • 전장적 연관 연구(GWAS)에서 여러 정신질환 간 공통된 유전자 변이를 견고하게 탐지할 수 있도록 하기 위해.

제안 방법

  • 이 방법은 두 연구의 쌍으로 이루어진 검정 통계량의 공동분포에 기반한 비모수적 접근법을 사용하며, 귀무분포나 대립분포에 대한 파라메트릭 형태를 가정하지 않는다.
  • FDR를 점차적으로 보수적으로 제어하기 위해, 검정 통계량 기반 기준에 따라 특징을 순위화하는 단계적 상향 절차를 적용한다.
  • 검정 통계량 간의 종속성에 대해 강건하며, 효과 크기나 분산 성분의 추정이 필요하지 않다.
  • 공동 p-값 또는 검정 통계량 순위를 활용하여 양측 연구에서 귀무가설을 기각하는 특징을 식별함으로써, 약한 종속성 가정 하에 FDR 제어를 보장한다.
  • 이 방법은 R 패키지 ssa에 구현되어 있어 다중 연구 유전체 데이터에 쉽게 적용할 수 있다.
  • 검정 통계량의 경험적 분포에서 유도된 데이터 기반의 임계값 규칙을 사용함으로써 조정 파rameter를 피한다.

실험 결과

연구 질문

  • RQ1두 연구 간 동시 신호를 식별할 때, 조정 파ram터가 없고 비모수적인 방법이 FDR을 효과적으로 제어할 수 있는가?
  • RQ2제안된 방법은 쌍으로 이루어진 연구에서 다중 검정에 대한 기존의 FDR 제어 절차와 비교해 검정력과 오류 제어에서 어떻게 성능을 내는가?
  • RQ3검정 통계량의 귀무분포나 대립분포에 대한 지식이 없이도 FDR 제어를 유지할 수 있는가?
  • RQ4실제의 GWAS 데이터에서 이 방법은 여러 정신질환 간 공통된 유전자 변이를 어느 정도 탐지할 수 있는가?
  • RQ5쌍으로 이루어진 연구에서 검정 통계량 간의 종속성에 대해 이 방법은 강건한가?

주요 결과

  • 시뮬레이션 결과, 제안된 방법은 특히 중간에서 높은 신호 강도를 가진 상황에서 기존 절차보다 높은 통계적 검정력을 확보했다.
  • 이 방법은 점차적으로 보수적인 FDR 제어를 제공하였으며, 복잡한 종속성 구조 하에서도 실제 FDR이 명목상 수준을 초과하지 않았다.
  • 다섯 가지 정신질환에 대한 GWAS 분 析에서, 이 방법은 다른 방법보다 더 많은 질병 쌍 간에 동시에 유의미한 유전자 변이를 공유하는 것으로 식별했다.
  • 이 방법은 연구 간에 동시에 유의미한 특징을 더 많이 탐지하여 민감도 향상을 시사했다.
  • 이 방법을 구현한 R 패키지 ssa는 다중 연구 유전체 데이터에 대한 효율적이고 접근 용이한 적용을 가능하게 했다.
  • 이 방법은 분포 가정이 없이도 기존 방법보다 유형 I 오류 제어와 검정력에서 뛰어난 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.