Skip to main content
QUICK REVIEW

[논문 리뷰] Adaptive Monte Carlo Multiple Testing via Multi-Armed Bandits

Martin Jinye Zhang, James Zou|arXiv (Cornell University)|2019. 02. 01.
Advanced Bandit Algorithms Research참고 문헌 53인용 수 5
한 줄 요약

이 논문은 대규모 다중 검정에서 몬테카를로 순열 검정의 계산 비용을 줄이기 위해 다중 손실 띠드 이론을 활용한 적응형 MC 다중 검정(AMT)을 제안한다. AMT는 전체 몬테카를로 검정과 동일한 위임 발견률 제어를 위해 nm 대신 Õ(√n m)개의 표본만을 사용함으로써 계산 시간을 월에서 수시간으로 단축시킨다. 실제 GWAS 데이터에서 검증되었다.

ABSTRACT

Monte Carlo (MC) permutation test is considered the gold standard for statistical hypothesis testing, especially when standard parametric assumptions are not clear or likely to fail. However, in modern data science settings where a large number of hypothesis tests need to be performed simultaneously, it is rarely used due to its prohibitive computational cost. In genome-wide association studies, for example, the number of hypothesis tests $m$ is around $10^6$ while the number of MC samples $n$ for each test could be greater than $10^8$, totaling more than $nm$=$10^{14}$ samples. In this paper, we propose Adaptive MC multiple Testing (AMT) to estimate MC p-values and control false discovery rate in multiple testing. The algorithm outputs the same result as the standard full MC approach with high probability while requiring only $ ilde{O}(\sqrt{n}m)$ samples. This sample complexity is shown to be optimal. On a Parkinson GWAS dataset, the algorithm reduces the running time from 2 months for full MC to an hour. The AMT algorithm is derived based on the theory of multi-armed bandits.

연구 동기 및 목표

  • 대규모 다중 검정, 특히 m ≈ 10^6개의 검정과 테스트당 n > 10^8개의 표본을 가진 GWAS에서 전체 몬테카를로(fMC) 순열 검정의 금방이 되는 계산 비용을 해결하기 위해.
  • 전체 몬테카를로 검정 결과(즉, 벤자민-호크베르그 위임 발견률 제어 이후 동일한 발견 결과)를 동일하게 복원할 수 있는 적응형 표본 추출 전략을 개발하기 위해.
  • 전체 몬테카를로 검정의 표본 수 nm를 Õ(√n m)으로 줄여 최적의 표본 복잡도를 달성하기 위해. 이는 정보 이론적으로 최적이 되는 것으로 입증되었다.
  • 현대 데이터 과학, 특히 게놈학에서 전체 몬테카를로 검정이 비현실적이지만 금전적 표준으로 여겨지는 검정을 실용적으로 적용할 수 있도록 하기 위해.

제안 방법

  • AMT는 다중 손실 띠드 이론을 활용해 추정된 p-값 정밀도와 발견 가능성에 기반해 m개의 귀무가설 검정에 대해 몬테카를로 표본을 적응적으로 할당한다.
  • 알고리즘은 몬테카를로 p-값에 대한 신뢰 구간을 유지하며, 불확실성이 높거나 위임 발견률 제어 하에서 발견 가능성이 가장 높은 가설에 대해 우선적으로 표본을 추출한다.
  • 정확도가 높은 결과 복원을 보장하기 위해 이항분포 유사 표본 추출에 대한 농도 부등식을 활용한 가능도 비율 기반 정지 기준을 적용한다.
  • 전체 표본 수를 최소화하면서 통계적 타당성을 유지하기 위해 탐색(불확실한 p-값에 대한 표본 추출)과 이용(유망한 후보 집중)을 동적으로 균형 잡는다.
  • 표본을 다시 넣지 않고 추출하는 비i.i.d. 표본 추출 방식을 사용하며, 다시 넣지 않고 추출하는 표본 추출의 새로운 분석 기법을 적용해 오차 확률을 제한한다.
  • 알고리즘은 전체 몬테카를로 방법과 동일한 발견 집합을 고확률로 출력하도록 설계되어 있어 통계적 충실도를 보장한다.

실험 결과

연구 질문

  • RQ1적응형 표본 추출이 전체 몬테카를로 검정 결과를 복원하기 위해 필요한 총 몬테카를로 표본 수를 줄일 수 있는가?
  • RQ2위임 발견률 제어 하에서 전체 몬테카를로 결과를 복원하기 위한 표본 복잡도 Õ(√n m)가 최적이 되는가?
  • RQ3다중 손실 띠드 원리가 몬테카를로 순열 검정에 효과적으로 적용되어 계산을 가속화하면서도 통계적 타당성을 손상시키지 않을 수 있는가?
  • RQ4대규모 가설 검정에서 총 표본 추출 비용을 최소화하면서도 전체 몬테카를로 결과를 고확률로 복원할 수 있는 방법은 무엇인가?

주요 결과

  • AMT는 전체 몬테카를로 결과를 복원하기 위한 총 몬테카를로 표본 수를 nm에서 Õ(√n m)으로 줄여, 전체 몬테카를로 결과 복원에 대해 증명 가능한 최적 표본 복잡도를 달성한다.
  • m ≈ 10^6개의 SNP와 테스트당 n ≈ 10^8개의 표본을 가진 파킨슨병 GWAS 데이터셋에서, AMT는 계산 시간을 2개월에서 약 1시간으로 단축시켰다.
  • 알고리즘은 전체 몬테카를로 방법과 동일한 발견 집합을 고확률로 복원하여 통계적 충실도를 보장한다.
  • 이론적 분석을 통해, p-값 분산이 유한하다는 가정 하에 Õ(√n m)이 이 복원 작업에 대해 최적의 표본 복잡도임을 증명하였다.
  • 가능도 비율 분석을 통해 어떤 대립가설 하에서도 오차 확률이 0에서 멀리 떨어져 있음을 입증하였으며, 이는 δ ≤ c8/8 인 경우 δ-정확 알고리즘이 존재할 수 없음을 보여주며, 기본적인 하한선을 설정한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.