Skip to main content
QUICK REVIEW

[논문 리뷰] Adjusting for selection bias in testing multiple families of hypotheses

Yoav Benjamini, Marina Bogomolov|arXiv (Cornell University)|2011. 06. 18.
Statistical Methods in Clinical Trials참고 문헌 24인용 수 10
한 줄 요약

이 논문은 다중 검정에서 가족별 가설이 검정 이전에 데이터 기반으로 선택될 때 발생하는 선택 편향을 보정하기 위한 일반적인 방법을 제안한다. 데이터 기반 임계값 설정 절차를 도입하여, 각 선택된 가족 내에서 유의수준을 조정함으로써 선택된 가족들에 대한 평균 오류율을 제어한다. 이는 FWER, FDR 및 일반화된 오류율을 포함한 광범위한 오류율 클래스에서 선택 이후에도 오류율 제어를 보장한다.

ABSTRACT

In many large multiple testing problems the hypotheses are divided into families. Given the data, families with evidence for true discoveries are selected, and hypotheses within them are tested. Neither controlling the error-rate in each family separately nor controlling the error-rate over all hypotheses together can assure that an error-rate is controlled in the selected families. We formulate this concern about selective inference in its generality, for a very wide class of error-rates and for any selection criterion, and present an adjustment of the testing level inside the selected families that retains the average error-rate over the selected families.

연구 동기 및 목표

  • 가장자리 가설이 검정 이전에 데이터 기반으로 선택될 때 다중 검정에서 발생하는 선택 편향 문제를 다루는 것.
  • FWER, FDR 및 일반화된 오류율을 포함한 광범위한 오류율 클래스에 적용 가능한 일반적 프레임워크에서 선택적 추론 문제를 수립하는 것.
  • 선택이 사전에 정의되지 않고 데이터 기반일 경우에도 선택된 가족들에 대한 평균 오류율을 제어할 수 있는 방법을 제공하는 것.
  • 모든 가족에 대한 오류율 제어뿐 아니라, 선택 이후 선택된 가족 내 조건부 오류율 제어를 유지하는 것.

제안 방법

  • 오류율을 랜덤 오류 측정값의 기댓값으로 표현함으로써 $ E(\mathcal{C}) $ 를 정의하여 FWER, FDR, FDX 및 $k$-FWER/$k$-FDR를 포함한 다양한 오류율을 다루는 것.
  • 모든 가족의 p-값 순서통계량에서 유도된 임계값을 사용하여 각 선택된 가정 내에서의 유의수준을 데이터 기반으로 조정하는 절차 도입.
  • 선택과 검정 간의 종속성을 모델링하기 위해, 가정 $i$에서 $k$-번째 기각과 p-값 분포에서 $r_i$-번째 순서통계량을 나타내는 공동사건 $ C_k^{(i)} \cap B_{r_i}^{(ij)}[k] $ 를 정의하는 것.
  • 진실된 귀무가설 하에서 p-값에 대한 PRDS(양의 회귀 종속성) 성질을 이용하여 조건부 확률의 확률적 단조성을 확립하는 것.
  • 가정들 및 p-값들 간 누적 기각 패턴을 나타내는 사건 $ A_s^{(ij)} $ 의 합집합을 구성하여 오류 확률의 재귀적 경계를 설정하는 것.
  • 조건부 확률의 합이 임계값을 초과할 때 1 이하로 제한됨을 증명함으로써 전체 오류율이 수준 $ q $ 에서 제어됨을 보장하며, 귀납법과 단조성 논증을 사용하는 것.

실험 결과

연구 질문

  • RQ1선택 규칙이 검정에 사용된 동일한 데이터에 의존할 경우, 선택된 가정들에 대한 오류율 제어를 유지할 수 있는가?
  • RQ2가장자리 가정들이 발견의 증거에 기반해 선택될 경우, 선택된 가정들 내에서의 유의수준을 조정하여 평균 오류율을 유지할 수 있는가?
  • RQ3선택적 추론 맥락에서 일반 오류율 클래스 $ E(\mathcal{C}) $ 는 어떻게 제어할 수 있는가?
  • RQ4특히 PRDS 가정 하에서, 데이터 기반 선택 이후 테스트 임계값을 조정하는 데 대한 이론적 기반은 무엇인가?
  • RQ5이 방법은 fMRI나 GWAS 연구와 같은 복잡한 계층적 또는 다요인 테스트 구조를 다룰 수 있도록 확장될 수 있는가?

주요 결과

  • 제안된 방법은 선택 기준이 데이터 기반일 경우에도 선택된 가정들에 대한 평균 오류율을 성공적으로 제어한다.
  • 각 선택된 가정 내에서의 유의수준 조정을 통해 선택 편향에도 불구하고 기댓값 오류 측정값 $ E(\mathcal{C}) $ 가 명목 수준 $ q $ 이하로 유지됨을 보장한다.
  • 이 방법은 많은 실용적 설정(예: 정규분포 및 순열 기반 모델 포함)에서 성립하는 p-값의 PRDS 가정 하에서 유효하다.
  • 증명은 조건부 기각 사건 확률의 재귀적 부등식에 기반하며, 이는 확률적 단조성 하에서 성립함을 보였다.
  • 전역 오류 제어를 보장하기 위해 경계 $ \sum_{t=1}^{mm_i} \sum_{(k,r_i)\in I_t} \text{Pr}(C_k^{(i)}, B_{r_i}^{(ij)}[k] \mid P_{ij} \leq tq/(mm_i)) \leq 1 $ 가 확립되었다.
  • 이 방법은 FWER, FDR, FDX 및 $k$-FWER를 포함한 광범위한 오류율 클래스로 일반화되어 있어 다양한 통계적 검정 프레임워크에 널리 적용 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.