Skip to main content
QUICK REVIEW

[논문 리뷰] On Online Control of False Discovery Rate

Adel Javanmard, Andrea Montanari|arXiv (Cornell University)|2015. 02. 22.
Advanced Bandit Algorithms Research참고 문헌 18인용 수 19
한 줄 요약

이 논문은 가설이 한 개씩 도착하고 과거 정보만을 사용해 결정을 내야 하는 순차적 다중가설 검정 환경에서, 잘못 발견률(FDR)과 경계 FDR(mFDR)를 제어하는 온라인 절차인 LORD와 LORD를 소개한다. 두 방법은 임의의 종속성 하에서도 FDR 제어를 보장하며, 희박한 대립가설이 있는 혼합 모델 하에서 거의 선형적인 발견률을 달성한다.

ABSTRACT

Multiple hypotheses testing is a core problem in statistical inference and arises in almost every scientific field. Given a sequence of null hypotheses $\mathcal{H}(n) = (H_1,..., H_n)$, Benjamini and Hochberg \cite{benjamini1995controlling} introduced the false discovery rate (FDR) criterion, which is the expected proportion of false positives among rejected null hypotheses, and proposed a testing procedure that controls FDR below a pre-assigned significance level. They also proposed a different criterion, called mFDR, which does not control a property of the realized set of tests; rather it controls the ratio of expected number of false discoveries to the expected number of discoveries. In this paper, we propose two procedures for multiple hypotheses testing that we will call "LOND" and "LORD". These procedures control FDR and mFDR in an \emph{online manner}. Concretely, we consider an ordered --possibly infinite-- sequence of null hypotheses $\mathcal{H} = (H_1,H_2,H_3,...)$ where, at each step $i$, the statistician must decide whether to reject hypothesis $H_i$ having access only to the previous decisions. To the best of our knowledge, our work is the first that controls FDR in this setting. This model was introduced by Foster and Stine \cite{alpha-investing} whose alpha-investing rule only controls mFDR in online manner. In order to compare different procedures, we develop lower bounds on the total discovery rate under the mixture model and prove that both LOND and LORD have nearly linear number of discoveries. We further propose adjustment to LOND to address arbitrary correlation among the $p$-values. Finally, we evaluate the performance of our procedures on both synthetic and real data comparing them with alpha-investing rule, Benjamin-Hochberg method and a Bonferroni procedure.

연구 동기 및 목표

  • 가설 수가 잠재적으로 무한할 수 있고, 과거 정보만을 사용해 결정을 내야 하는 온라인 순차적 다중가설 검정 환경에서 FDR 제어 문제를 해결하기 위해.
  • 기존 방법들인 알파-인베스팅과 벤자민리-하우크베르그의 한계를 극복하여, 온라인 환경에서 FDR과 mFDR을 제어하는 절차를 개발하기 위해.
  • 희박한 비귀무가설이 있는 혼합 모델과 임의의 p값 종속성 하에서 발견률에 대한 이론적 보장을 수립하기 위해.
  • p값 간 임의의 상관관계를 다룰 수 있는 LORD의 강건한 변형을 제안하기 위해.
  • 합성 데이터와 실질 데이터에서 벤자민리-하우크베르그, 알파-인베스팅, 보프러니와 같은 기존 방법들과의 비교를 통해 성능을 실증적으로 평가하기 위해.

제안 방법

  • 과거 발견 수와 감쇠 파라미터에 기반한 적응형 임계값을 사용하여 FDR과 mFDR을 각각 제어하는 온라인 절차인 LORD(Lond)와 LORD(Lord)를 제안한다.
  • 과거 발견 수와 감쇠 파라미터에 따라 동적으로 조정되는 의미 수준 임계값을 위한 재귀적 업데이트 규칙을 적용한다.
  • 혼합 모델 하에서 재생 과정 프레임워크를 사용하여 기대 발견 수에 대한 이론적 경계를 도출한다.
  • p값 간 임의의 종속성을 다루기 위해 수정된 보정 항을 포함한 LORD의 변형을 도입한다.
  • 확률적 지배성 논증과 재생 이론을 사용하여 기대 간격 발견 시간이 유계임을 증명함으로써 선형 발견률을 보장한다.
  • 재귀 부등식과 귀납 기반 증명을 통해 시간이 지남에 따라 기대 임계값에서의 편차가 유계로 유지됨을 보여준다.

실험 결과

연구 질문

  • RQ1가설이 한 개씩 도착하고 과거 정보만을 사용해 결정을 내야 하는 온라인 순차적 다중가설 검정 프레임워크에서 FDR를 제어할 수 있는가?
  • RQ2총 가설 수를 알지 못하는 상황에서, 발견력과 FDR 제어 사이의 최적의 트레이드오프는 무엇인가?
  • RQ3혼합 모델 하에서 진정한 비귀무가설의 희박성에 따라 온라인 FDR 절차의 발견률은 어떻게 척도가 설정되는가?
  • RQ4p값 간 임의의 종속성 하에서도 FDR 제어를 유지할 수 있으며, 이러한 종속성은 어떻게 보정할 수 있는가?
  • RQ5벤자민리-하우크베르그와 알파-인베스팅과 같은 전통적 방법들과 비교했을 때, LORD와 LORD의 실증적 성능은 어떠한가?

주요 결과

  • LORD와 LORD는 각 가설이 고정 확률 ε로 비귀무이며, 비귀무 하에서 p값이 i.i.d.일 때 혼합 모델 하에서 거의 선형적인 발견률을 달성한다.
  • 기대 발견 수는 테스트한 가설 수에 따라 선형적으로 증가하며, 평균 간격 발견 시간 μ에 대해 1/μ에 수렴하는 비율을 가진다.
  • 절차들은 온라인 환경에서 FDR과 mFDR을 제어하며, 수정된 LORD를 통해 임의의 종속성 하에서도 FDR 제어가 증명된다.
  • 이론적 분석을 통해 기대 경로에서의 임계값 편차가 유계로 유지됨을 보여, 안정성과 장기적 제어를 보장한다.
  • 합성 및 실질 데이터에 대한 실증 평가에서, LORD와 LORD는 알파-인베스팅, 벤자민리-하우크베르그, 보프러니보다 발견력이 뛰어나면서도 FDR 제어를 유지한다.
  • 총 가설 수가 알려지지 않거나 무한한 경우에도 강력한 이론적 보장을 확보하며, 기대 거짓 발견 수에 대한 경계를 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.