Skip to main content
QUICK REVIEW

[논문 리뷰] The Power of Batching in Multiple Hypothesis Testing

Tijana Zrnic, Daniel Jiang|arXiv (Cornell University)|2019. 10. 11.
Statistical Methods in Clinical Trials참고 문헌 21인용 수 4
한 줄 요약

이 논문은 복수의 배치를 거쳐 순차적이고 적응적인 가설 검정을 수행하면서도 공식적인 FDR 제어를 유지하는 새로운 FDR 제어 알고리즘인 Batch_BH와 Batch_St-BH를 소개한다. 배치 기반 프레임워크 내에서 Benjamini-Hochberg 및 Storey-BH 절차를 재활용함으로써, 이 방법들은 온라인 방법보다 높은 통계적 검정력과 난잡한 배치 방법보다 더 강력한 FDR 보장을 달성하여 오프라인과 온라인 다중 가설 검정 접근법 사이의 격차를 메운다.

ABSTRACT

One important partition of algorithms for controlling the false discovery rate (FDR) in multiple testing is into offline and online algorithms. The first generally achieve significantly higher power of discovery, while the latter allow making decisions sequentially as well as adaptively formulating hypotheses based on past observations. Using existing methodology, it is unclear how one could trade off the benefits of these two broad families of algorithms, all the while preserving their formal FDR guarantees. To this end, we introduce $ ext{Batch}_{ ext{BH}}$ and $ ext{Batch}_{ ext{St-BH}}$, algorithms for controlling the FDR when a possibly infinite sequence of batches of hypotheses is tested by repeated application of one of the most widely used offline algorithms, the Benjamini-Hochberg (BH) method or Storey's improvement of the BH method. We show that our algorithms interpolate between existing online and offline methodology, thus trading off the best of both worlds.

연구 동기 및 목표

  • 오프라인 FDR 방법의 높은 통계적 검정력과 온라인 FDR 방법의 적응성 사이의 상충 관계를 해결하기 위해.
  • 무한한 수의 가설 배치를 순차적으로 검정할 때 FDR을 제어할 수 있는 프레임워크를 개발하기 위해.
  • 기본적으로 FDR 제어가 이루어지지 않는, 반복적으로 오프라인 FDR 절차(예: BH 및 Storey-BH)를 배치 간에 적용함으로써 발생하는 문제를 방지하기 위해.
  • 과거 결과에 기반한 적응적 가설 생성을 가능하게 하면서도 전체 시퀀스와 각 개별 배치 모두에서 FDR 제어를 유지하기 위해.
  • 오프라인 방법의 안정성과 온라인 방법의 순차적 결정 능력을 동시에 확보하는 방법을 제공하기 위해.

제안 방법

  • 다양한 배치 간에 Benjamini-Hochberg 및 Storey-BH 절차를 순차적으로 조합한 Batch_BH와 Batch_St-BH를 제안한다.
  • 각 배치에 대해 BH 및 Storey-BH 절차를 독립적으로 적용하며, 전체 FDR 제어를 유지하기 위해 배치별로 감소하는 유의수준을 사용한다.
  • 일반 조건 하에서 FDR 제어를 보장하기 위해 p-값 시퀀스에 대해 보수적인 의존성 가정을 사용한다.
  • 조건부 기대값과 탑재 성질을 사용하여 이론적 FDR 경계를 유도하며, FDR가 명목 수준 α의 최대 {1, δ} 배 이내로 제어됨을 보여준다.
  • Null 가설이 기각되었을 경우와 아닐 경우의 기대 발견 수의 불균형을 고려하기 위해 보정 항목 ε_i 를 도입한다.
  • 양의 상관성을 가진 p-값을 다룰 수 있도록, 조정된 유의수준을 사용하는 수정된 배치 절차를 통해 프레임워크를 확장한다.

실험 결과

연구 질문

  • RQ1순차적 가설 검정에서 오프라인 FDR 절차의 높은 검정력과 온라인 절차의 적응성의 장점을 결합할 수 있는 방법을 설계할 수 있는가?
  • RQ2BH나 Storey-BH와 같은 오프라인 FDR 알고리즘을 배치 간에 반복적으로 적용해도 FDR 제어 보장이 유지되는가?
  • RQ3전체 검정 시퀀스뿐 아니라 개별 배치 또는 하위 집단에 대해서도 FDR 제어를 보장할 수 있는가?
  • RQ4온라인 환경에서 오프라인 알고리즘을 재사용하는 배치 절차의 FDR에 대해 수립할 수 있는 이론적 경계는 무엇인가?
  • RQ5통계적 검정력과 FDR 제어 측면에서 제안된 배치 방법은 순수하게 온라인 또는 순수하게 오프라인 FDR 방법과 비교해 어떻게 성능을 발휘하는가?

주요 결과

  • Batch_BH와 Batch_St-BH는 난잡한 오프라인 방법의 순차적 적용과 달리 전체 검정 시퀀스와 각 개별 배치 모두에서 공식적인 FDR 제어를 달성한다.
  • 제안된 방법의 FDR는 max{1, δ} × α 이하로 제한되며, 여기서 δ는 null 가설이 기각되었을 경우와 아닐 경우의 기대 발견 수 비율의 Supremum이다.
  • 이 방법들은 발견 집합이 가설의 순서에 영향을 받지 않는다는 점에서 오프라인 절차의 안정성을 그대로 이어받는다. 반면 온라인 방법은 그렇지 않다.
  • 합성 데이터를 이용한 실험 결과, Batch_BH와 Batch_St-BH는 최신 온라인 FDR 방법보다 높은 통계적 검정력을 확보하면서도 FDR 제어를 유지함을 보였다.
  • 이 프레임워크는 과거 결과에 기반한 적응적 가설 생성을 가능하게 하여, 산업 현장에서의 대규모 순차적 검정(예: A/B 테스트) 응용에 적합하다.
  • 이 알고리즘들은 실용성과 보편성을 입증하기 위해 onlineFDR R 패키지에 통합되었으며, 실제 적용 사례에서의 유용성과 수용도를 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.