Skip to main content
QUICK REVIEW

[논문 리뷰] BONuS: Multiple multivariate testing with a data-adaptivetest statistic

Chiao-Yu Yang, Lihua Lei|arXiv (Cornell University)|2021. 06. 29.
Statistical Methods in Clinical Trials참고 문헌 33인용 수 4
한 줄 요약

BONuS는 다중 다변량 검정을 위한 데이터 적응형 베이지안 프레임워크로, 전체 데이터셋에서 최적의 p값 변환을 학습함으로써 통계적 검정력(통계적 검정 능력)을 향상시키지만, 유한 표본에서 잘못된 모형 가정 하에서도 가짜 발현률(FDR)을 엄격히 통제한다. 이는 가려진 데이터 기반 설계를 통해 분석자가 모델을 상호작용적으로 구축해도 FDR 통제를 유지할 수 있도록 한다.

ABSTRACT

We propose a new adaptive empirical Bayes framework, the Bag-Of-Null-Statistics (BONuS) procedure, for multiple testing where each hypothesis testing problem is itself multivariate or nonparametric. BONuS is an adaptive and interactive knockoff-type method that helps improve the testing power while controlling the false discovery rate (FDR), and is closely connected to the "counting knockoffs" procedure analyzed in Weinstein et al. (2017). Contrary to procedures that start with a $p$-value for each hypothesis, our method analyzes the entire data set to adaptively estimate an optimal $p$-value transform based on an empirical Bayes model. Despite the extra adaptivity, our method controls FDR in finite samples even if the empirical Bayes model is incorrect or the estimation is poor. An extension, the Double BONuS procedure, validates the empirical Bayes model to guard against power loss due to model misspecification.

연구 동기 및 목표

  • 각 귀무가설이 고차원 또는 비모수적 데이터를 포함하는 다중 검정 상황에서 관계없는 다변량 검정의 낮은 검정력을 해결하기 위해.
  • 모든 귀무가설에 걸쳐 평균 검정력을 향상시키기 위해 연합 데이터 분포에서 최적의 검정통계량을 학습하는 방법을 개발하기 위해.
  • 실제 데이터에서 모형이 잘못 설정되거나 잘 추정되지 않은 경우에도 유한 표본에서 FDR 통제를 보장하기 위해.
  • 분석자가 합성 기준군을 사용해 검정통계량을 개선할 수 있는 강력하고 상호작용 가능한 프레임워크를 제공하기 위해.

제안 방법

  • BONuS는 모든 n개의 다변량 귀무가설에서 정보를 통합하여 데이터 적응형 p값 변환을 추정하기 위해 null 통계량의 가방(모음) 접근법을 사용한다.
  • 분석자로부터 일부 데이터를 숨기는 가려진 데이터 설계를 적용하여, FDR 통제를 유지하면서도 안전하게 상호작용적인 모델 피팅을 가능하게 한다.
  • 사전 설정된 α 수준 이하에서 FDP 추정기(오차율 추정기)가 유지되는 가장 큰 기각 영역을 선택함으로써 최적의 중첩 기각 영역 시퀀스를 추정한다.
  • 실제 데이터로부터 대안적 매개변수에 대한 사전 분포를 학습하기 위해 경험 베이지안 모형을 사용하며, 귀무가설에서 벗어나기 쉬운 방향성에 집중한다.
  • 더블 BONuS 확장은 교차검증 유사 검증을 통해 여러 모델을 테스트하고 최고 성능을 보이는 모델을 선택함으로써 모형 오류의 영향을 최소화한다.
  • 다변량 정규분포 및 다항분포 설정에서는 강력한 공분산 추정과 합성 기준군 생성을 통해 종속성 하에서 유효한 귀무분포를 구성한다.

실험 결과

연구 질문

  • RQ1관계없는 방법(예: GLRT)과 비교해 데이터 적응형 검정통계량이 다변량 다중 검정에서 유의미하게 검정력을 향상시킬 수 있는가, 특히 저차원 설정에서?
  • RQ2경험 베이지안 사전 모형이 잘못되었거나 잘 추정되지 않은 경우에도 BONuS 절차가 유한 표본에서 FDR 통제를 유지하는가?
  • RQ3실제 응용 분야, 예를 들어 다변량 표현형을 가진 전장 유전자 연관 연구(GWAS)에서 BONuS는 어떤 성능을 보이는가?
  • RQ4더블 BONuS 절차는 모형 검증을 통해 모형 오류로 인한 검정력 손실을 효과적으로 방지할 수 있는가?
  • RQ5기저 신호가 희박하고 방향성이 있는 경우, BONuS는 벤자민리-호크베르그(Benjamini-Hochberg)와 같은 표준 FDR 절차를 얼마나 뛰어나게 성능을 내는가?

주요 결과

  • 10차원 정규분포 시뮬레이션에서, 신호 방향을 플러그인 추정기로 추정한 BONuS는 거의 오라클 수준의 검정력을 달성했으며, GLRT 및 관계없는 방법들보다 유의미하게 뛰어난 성능을 보였다.
  • 다중 검정 상황에서 BONuS는 GLRT 통계량을 사용한 벤자민리-호크베르그 절차보다 유의미하게 높은 진짜 발견 비율을 달성했으며, 특히 낮은 α 수준에서 두드러졌다.
  • 대사 증후군 GWAS 연구에서 BONuS는 관계없는 방법보다 더 많은 발견을 했으며, 각 SNP의 효과가 예상대로 희박하기 때문에 성과 향상은 측정 가능하지만 다소 보수적인 수준이었다.
  • 더블 BONuS 절차는 여러 모델을 검증하고 최고 성능의 모델을 선택함으로써 강건성을 입증했으며, 모형 오류로 인한 검정력 손실을 줄였다.
  • 모든 실험에서 BONuS는 경험 베이지안 모형이 잘못 설정된 경우에도 유한 표본 FDR 통제를 유지했으며, 이는 이론적 강건성을 확인했다.
  • 다변량 및 GWAS 적용 사례에서 종속성 구조 하에서도 메트릭 성능이 안정했으며, 강력한 공분산 추정을 통해 유효한 합성 기준군 생성이 가능했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.