[논문 리뷰] Generalized estimators for multiple testing: proportion of true nulls and false discovery rate
이 논문은 이산 p-값의 근원 분포가 균일 분포를 지배하는 경우를 다루기 위해, 근본적인 근무가정의 비율과 다중 검정 절차에서의 잘못된 발견률(FDR)을 위한 일반화된 추정기 두 가지를 제안한다. 기존 연구를 확장하여 제안된 FDR 추정기는 종속성 하에서도 동시에 점점 더 보수적인 성향을 보이며 정지 시간 성질을 갖는다. 실증 결과는 다음 세대 시퀀싱 데이터에서 경쟁자들보다 향상된 성능을 보여준다.
Summary. Two new estimators are proposed: the first for the proportion of true null hypotheses and the second for the false discovery rate (FDR) of one-step multiple testing procedures (MTPs). They generalize similar estimators developed jointly by Storey, Taylor and Siegmund and can be applied also to discrete p-values whose null distributions dominate the uniform distribution. For the new estimator of the FDR, we establish its simultaneous asymptotic conservativeness and justify formally the stopping time property of its threshold for p-values not necessarily independent or continuous. Our empirical studies show that, when applied to the aforementioned p-values, both of our estimators usually outperform their competitors (considered in this work) except that the first one may under-estimate the target when the needed tuning parameters are inappropriately chosen. The methodology of our work easily extends to other types of discrete p-values. We illustrate the improvement in power our estimators can induce by applying them to next-generation sequencing count data.
연구 동기 및 목표
- 이슬람 분포가 균일 분포를 지배하는 이산 p-값에 적용 가능한 진정한 근본 가설의 비율과 FDR 추정기를 개발하는 것.
- 스토리, 테일러, 시에그문드의 기존 추정기를 더 넓은 범주인 이산 p-값으로 확장하는 것.
- 종속성 하에서도 동시에 점점 더 보수적인 성향과 정지 시간 행동을 갖는 FDR 추정기의 이론적 성질을 확립하는 것.
- 특히 다음 세대 시퀀싱 계수 데이터에서 실세계 적용 사례에서 더 높은 통계적 검정력과 정확도를 입증하는 것.
- 현재 범위를 넘어서는 다른 종류의 이산 p-값으로 일반화 가능한 민첩한 프레임워크를 제공하는 것.
제안 방법
- 조정 파라미터를 사용하여 이산 p-값에 대한 민감도를 제어하는 진정한 근본 가설 비율에 대한 일반화된 추정기를 제안한다.
- 다중 검정 절차 전반에 걸쳐 점점 더 보수적인 성향을 유지하는 새로운 FDR 추정기를 도입한다.
- p-값 기반의 임계값 설정 메커니즘을 적용하여 종속성이나 비연속적인 p-값이 존재하더라도 정지 시간 성질을 유지한다.
- 이산 p-값의 근본 분포에 대한 지배 조건(균일 분포 지배)을 활용하여 추정기의 타당성을 정당화한다.
- 모의 및 실제 다음 세대 시퀀싱 데이터를 활용한 실증 연구를 통해 기존 경쟁자들과의 성능을 평가한다.
- 분포 지배 기반의 일반화된 프레임워크를 통해 다른 이산 p-값 가족으로의 방법론 확장을 수행한다.
실험 결과
연구 질문
- RQ1근본 분포가 균일 분포를 지배하는 이산 p-값 설정에서 진정한 근본 가설의 비율을 더 정확하게 추정할 수 있는가?
- RQ2제안된 FDR 추정기는 종속성과 비연속적인 p-값 하에서도 보수성과 타당성을 유지하는가?
- RQ3특히 시퀀싱 데이터에서 새로운 추정기의 성능은 편향과 검정력 측면에서 기존 경쟁자들과 비교해 어떻게 되는가?
- RQ4이산 데이터를 포함한 다중 검정 시나리오에서 새로운 추정기는 통계적 검정력을 얼마나 향상시킬 수 있는가?
- RQ5현재 적용 범위를 넘어서 다른 종류의 이산 p-값으로도 이 메서드 프레임워크를 일반화할 수 있는가?
주요 결과
- 제안된 진정한 근본 가설 비율 추정기는 일반적으로 경쟁자들을 능가하지만, 조정 파라미터가 부적절하게 선택될 경우 목표를 과소 추정할 수 있다.
- FDR 추정기는 동시에 점점 더 보수적인 성향을 보이며 기대되는 잘못된 발견 비율을 제어함을 보여준다.
- p-값이 종속적이거나 비연속적일 경우에도 FDR 추정기는 임계값에 대해 정지 시간 성질을 나타내어 순차적 검정에서의 사용을 정당화한다.
- 다음 세대 시퀀싱 데이터에 대한 실증 결과는 새로운 추정기가 통계적 검정력을 의미 있게 향상시킬 수 있음을 보여준다.
- 이론적 방법은 균일 분포를 지배하는 분포를 가진 다른 이산 p-값 가족으로도 강건하고 확장 가능하다.
- 특히 이산적이고 종속적인 p-값이 존재하는 환경에서 유한 표본에서 뛰어난 성능을 보인다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.