Skip to main content
QUICK REVIEW

[논문 리뷰] Testing hypotheses on a tree: new error rates and controlling strategies

Marina Bogomolov, Christine B. Peterson|arXiv (Cornell University)|2017. 05. 22.
Genetic Associations and Epidemiology참고 문헌 23인용 수 16
한 줄 요약

이 논문은 계층적 트리 구조의 가설에서 다중 해상도 수준에서 가짜 발현률(FDR)을 제어하는 새로운 다중 검정 절차인 TreeBH를 소개한다. 종속성 가정과 순차적 검정 알고리즘을 활용함으로써, 기존 방법에 비해 통계적 검정력이 향상되면서도 FDR 제어를 유지함을 시뮬레이션과 GTEx 및 마이크로바이옴 데이터에 대한 실제 적용 사례를 통해 입증하였다.

ABSTRACT

We introduce a multiple testing procedure (TreeBH) which addresses the challenge of controlling error rates at multiple levels of resolution. Conceptually, we frame this problem as the selection of hypotheses which are organized hierarchically in a tree structure. We describe a fast algorithm for the proposed sequential procedure, and prove that it controls relevant error rates given certain assumptions on the dependence among the p-values. Through simulations, we demonstrate that TreeBH offers the desired guarantees under a range of dependency structures (including one similar to that encountered in genome-wide association studies) and that it has the potential of gaining power over alternative methods. We also introduce a modified version of TreeBH which we prove to control the relevant error rates under any dependency structure. We conclude with two case studies: we first analyze data collected as part of the Genotype-Tissue Expression (GTEx) project, which aims to characterize the genetic regulation of gene expression across multiple tissues in the human body, and secondly, data examining the relationship between the gut microbiome and colorectal cancer.

연구 동기 및 목표

  • 계층적 가설 검정에서 다중 해상도 수준에서 오류율을 제어하는 데 도전하는 문제를 해결한다.
  • 모든 가설을 동일하게 취급하는 대신, 가설이 트리 구조로 구성되어 있을 때 FDR 제어를 유지하는 방법을 개발한다.
  • 가설의 계층적 구조를 활용하여 세밀한 가설의 불필요한 검정을 줄임으로써 통계적 검정력을 향상시킨다.
  • 해상도 순서로 데이터를 순차적으로 수집하는 데 적용 가능한 프레임워크를 제공한다.
  • 실제 유전체 데이터에서 관찰되는 바와 같은 다양한 p-값 간 종속성 구조에 대해 강건성을 확보한다.

제안 방법

  • 트리 구조를 따라 상향식 순서로 가설을 검정하는 순차적 다중 검정 절차인 TreeBH를 제안한다.
  • 각 노드에서의 가설을 기각하는 조건은 하류 노드 기반으로 동적으로 조정된 임계값 이하의 p-값을 가질 경우에 한하여 설정하는 단계적 절차를 사용한다.
  • 가설 트리의 구조에 대해 양의 회귀 종속성(PRDS)을 가정할 때 트리의 각 수준에서 FDR을 제어한다.
  • 임의의 종속성 구조에서도 FDR을 제어할 수 있도록 개선된 TreeBH 변형을 도입하여 강건성을 확보한다.
  • 잎에서 루트로 순차적으로 트리를 순회하는 빠른 알고리즘을 구현하며, 임계값을 자식 노드에서부터 재귀적으로 계산한다.
  • GTEx 및 마이크로바이옴 연구에서 실제 데이터에 적용하기 위해, SNPs(레벨 1), 유전자(레벨 2), 조직(레벨 3)을 계층적 트리로 묶는다.

실험 결과

연구 질문

  • RQ1트리 구조의 가설 공간에서 다중 해상도 수준에서 FDR을 동시에 제어할 수 있는가?
  • RQ2가설의 계층적 구조를 활용하면 BH나 BB와 같은 표준 FDR 제어 절차에 비해 통계적 검정력을 향상시킬 수 있는가?
  • RQ3실제 다기관 eQTL 연구에서 관찰되는 바와 같은 현실적인 종속성 구조 하에서 TreeBH는 어떻게 성능을 발휘하는가?
  • RQ4강한 가정 없이도 p-값 간 임의의 종속성 구조에서 작동하도록 절차를 적응시킬 수 있는가?
  • RQ5GTEx 및 마이크로바이옴 연구와 같은 실제 다중오미크스 데이터셋에 적용했을 때 TreeBH는 오류율 제어를 유지하는가?

주요 결과

  • TreeBH는 실제 다기관 eQTL 데이터를 모방한 다양한 종속성 구조에서 트리의 모든 수준에서 목표 FDR을 약간 초과하지 않고 제어한다.
  • 기준 BB 절차와 유사한 FDR, sFDR 및 검정력을 달성하지만, 희박한 신호 조건 하에서 오류율 제어가 더 우수하다.
  • 5개의 조직에서 8,713개의 SNP와 250개의 유전자를 포함한 시뮬레이션에서 TreeBH는 BH보다 FDR 제어 성능이 뛰어나 목표 오류율을 유지하였다.
  • 개선된 TreeBH 변형은 임의의 종속성 구조 하에서도 FDR을 성공적으로 제어하여, PRDS 가정을 초월한 메서드의 강건성을 확장하였다.
  • GTEx 사례 연구에서 TreeBH는 제어된 오류율 하에 다양한 해상도 수준에서 생물학적으로 의미 있는 eGenes와 eSNPs를 식별하였다.
  • 마이크로바이옴 연구에서 TreeBH는 가족 및 분류 수준에서의 연관성을 효과적으로 탐지하여, 복잡한 미생물 공동체 분석에 유용성을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.