Skip to main content
QUICK REVIEW

[논문 리뷰] Sequential Tests of Multiple Hypotheses Controlling False Discovery and Nondiscovery Rates

Jay Bartroff, Jinlin Song|arXiv (Cornell University)|2013. 11. 14.
Statistical Methods in Clinical Trials참고 문헌 52인용 수 11
한 줄 요약

이 논문은 스트리밍 데이터에 대한 다중 가설 검정을 위한 새로운 방법인 순차적 BH 절차를 소개한다. 이 방법은 최소한의 가정 하에 동시에 통제하는 FDR(거짓 발견률)과 FNR(거짓 비발견률)를 보장한다. 벤자민-하코버그의 고정 표본 FDR 절차를 순차적 설정으로 확장하여 순차적 검정 통계량을 사용함으로써, 임의의 종속성 하에서도 로그 증폭 인자로 통제가 가능하며, 그룹 순차적 및 잘라내기 설계를 포함한 다양한 샘플링 계획을 지원한다.

ABSTRACT

We propose a general and flexible procedure for testing multiple hypotheses about sequential (or streaming) data that simultaneously controls both the false discovery rate (FDR) and false nondiscovery rate (FNR) under minimal assumptions about the data streams which may differ in distribution, dimension, and be dependent. All that is needed is a test statistic for each data stream that controls the conventional type I and II error probabilities, and no information or assumptions are required about the joint distribution of the statistics or data streams. The procedure can be used with sequential, group sequential, truncated, or other sampling schemes. The procedure is a natural extension of Benjamini and Hochberg's (1995) widely-used fixed sample size procedure to the domain of sequential data, with the added benefit of simultaneous FDR and FNR control that sequential sampling affords. We prove the procedure's error control and give some tips for implementation in commonly encountered testing situations.

연구 동기 및 목표

  • 최소한의 분포 가정 하에 일반적이고 융통성 있는 순차적 다중 가설 검정 절차를 개발하는 것.
  • 기존의 벤자민-하코버그 절차를 고정 표본에서 순차적 데이터 스트림으로 확장하면서 FDR 통제를 유지하고 FNR 통제도 추가하는 것.
  • 종속적이거나 동일분포가 아니거나 고차원적인 데이터 스트림이 존재하는 환경에서도 공동 분포 가정 없이 적용 가능하게 하는 것.
  • 일반적인 통계적 상황에서 구성 요소 순차 검정과 임계값을 구성하기 위한 실용적 지침을 제공하는 것.
  • 시뮬레이션을 통해 절차의 성능을 평가하고 고정 표본 대비와 비교하는 것.

제안 방법

  • 스트리밍 데이터에 특화된 순차적 벤자민-하코버그 절차의 확장인 순차적 BH 절차를 제안한다.
  • 각 데이터 스트림에 대해 개별 검정 통계량을 사용하여 전통적인 I형 오류 및 II형 오류 비율을 통제하며, 공동 분포 가정이 필요로 하지 않는다.
  • 기각(및 선택적으로 비기각)을 위한 조기 정지 기능을 포함한 순차적 샘플링을 적용하여 동적 의사결정을 가능하게 한다.
  • 왈드 유사 근사와 일반화된 우도 비율 통계량을 사용하여 순차 검정의 임계값을 유도한다.
  • FDR는 통제하지만 FNR은 반드시 통제하지 않는 반복적 버전을 구현하여 FNR 통제가 우선순위가 아닐 경우에 유용하다.
  • 순차적 증명을 위해 재귀적 경계와 샘플 공간 분할을 사용하여, 독립성 하에서는 FDR과 FNR을 통제하고, 임의의 종속성 하에서는 로그 증폭 인자를 통해 통제한다.

실험 결과

연구 질문

  • RQ1데이터 스트림에 대한 최소한의 가정 하에 순차적 다중 가설 검정 절차가 FDR과 FNR을 동시에 통제할 수 있는가?
  • RQ2벤자민-하코버그 절차는 어떻게 순차적 또는 스트리밍 데이터에 적응시킬 수 있으며, FDR 통제를 유지할 수 있는가?
  • RQ3데이터 스트림 간의 종속성이 순차적 검정에서 FDR과 FNR 통제에 어떤 영향을 미치는가?
  • RQ4일반적인 통계 모델에서 순차 검정의 임계값을 닫힌 형태로 어떻게 도출할 수 있는가?
  • RQ5순차 절차의 성능은 고정 표본 대비와 비교하여 오류 통제 및 검정력 측면에서 어떻게 다른가?

주요 결과

  • 순차적 BH 절차는 임의의 종속성 하에서도 로그 증폭 인자를 통해 FDR을 통제하며, 벤자민과 하코버그의 원래 FDR 증명 조건을 그대로 따르고 있다.
  • 데이터 스트림이 상호 독립일 경우 절차는 $\alpha \cdot (K_0 / K)$ 수준에서 FDR을 통제한다. 여기서 $K_0$는 진정한 귀무가설의 수이고 $K$는 총 가설 수이다.
  • 절차는 FNR(거짓 비발견률) 또한 대칭적인 증명 구조를 통해 통제하며, 순차적 설정에서 두 오류율을 동시에 통제함을 보장한다.
  • 반복적 버전의 절차는 FDR은 통제하지만 FNR은 반드시 통제하지는 않으며, FNR 통제가 필요하지 않은 경우에 유용한 트레이드오프를 제공한다.
  • 시뮬레이션 연구 결과 절차는 강력한 오류 통제를 유지하며, 고정 표본 대비 순차적 설정에서 더 높은 효율성을 보였다.
  • 일반적인 검정 상황에 대해 닫힌 형태의 임계값이 도출되어 최소한의 계산 오버헤드로 실용적 구현이 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.