Skip to main content
QUICK REVIEW

[論文レビュー] Adaptive Monte Carlo Multiple Testing via Multi-Armed Bandits

Martin Jinye Zhang, James Zou|arXiv (Cornell University)|Feb 1, 2019
Advanced Bandit Algorithms Research参考文献 53被引用数 5
ひとこと要約

本稿では、大規模な多重仮説検定におけるモンテカルロパーミュテーション検定の計算コストを低減するために、マルチアームバンディットの原則を用いた、適応的MC多重仮説検定(AMT)を提案する。AMTは、フルモンテカルロテストと同等の誤り発見率(FDR)制御を、nmではなく Õ(√n m) のサンプル数で達成し、実際のGWASデータでは実行時間を数か月から数時間に短縮する。

ABSTRACT

Monte Carlo (MC) permutation test is considered the gold standard for statistical hypothesis testing, especially when standard parametric assumptions are not clear or likely to fail. However, in modern data science settings where a large number of hypothesis tests need to be performed simultaneously, it is rarely used due to its prohibitive computational cost. In genome-wide association studies, for example, the number of hypothesis tests $m$ is around $10^6$ while the number of MC samples $n$ for each test could be greater than $10^8$, totaling more than $nm$=$10^{14}$ samples. In this paper, we propose Adaptive MC multiple Testing (AMT) to estimate MC p-values and control false discovery rate in multiple testing. The algorithm outputs the same result as the standard full MC approach with high probability while requiring only $ ilde{O}(\sqrt{n}m)$ samples. This sample complexity is shown to be optimal. On a Parkinson GWAS dataset, the algorithm reduces the running time from 2 months for full MC to an hour. The AMT algorithm is derived based on the theory of multi-armed bandits.

研究の動機と目的

  • 大規模な多重仮説検定、特にm ≈ 10^6の検定と1テストあたりn > 10^8のサンプルを持つGWASにおいて、フルモンテカルロ(fMC)パーミュテーション検定の非現実的な計算コストに対処すること。
  • フルモンテカルロテストの結果(つまり、Benjamini-Hochberg FDR制御後の同一の発見)を顕著に少ないMCサンプル数で回復できる適応的サンプリング戦略を開発すること。
  • 全サンプル数をnmから Õ(√n m) に削減することで、情報理論的に最適なサンプル複雑度を達成すること。
  • 現代のデータサイエンス、特にゲノミクスにおいて、ゴールドスタンダードとされるMCパーミュテーション検定を実用的に適用可能にするための基盤を提供すること。

提案手法

  • AMTはマルチアームバンディット理論を用いて、推定されたp値の精度と発見可能性に基づき、m個の仮説検定にMCサンプルを適応的に割り当てる。
  • アルゴリズムはMC p値の信頼区間を維持し、不確実性が高く、かつFDR制御下で発見が最も可能性が高い仮説に対して優先的にサンプリングを行う。
  • 尤度比に基づく停止基準を採用し、高確率でfMC結果を回復することを保証する。これは、超幾何分布に類似したサンプリングに対する集中不等式を活用する。
  • 全サンプル数を最小限に抑えるとともに統計的妥当性を保つために、探索(不確実なp値のサンプリング)と活用(有望な候補への集中)の動的バランスを取る。
  • サンプルを置換なしでパーミュテーションデータから抽出する非i.i.d.なサンプリング方式を採用し、置換なしサンプリングの新しい解析を用いて誤差確率の上限を導出する。
  • アルゴリズムは、高確率でフルMCアプローチと同一の発見集合を出力するように設計されており、統計的整合性を保証する。

実験結果

リサーチクエスチョン

  • RQ1適応的サンプリングは、フルモンテカルロテストと同等の多重仮説検定結果を回復するために必要なMCサンプル総数を削減できるか?
  • RQ2FDR制御下の多重仮説検定において、フルMC結果を回復するためのサンプル複雑度 Õ(√n m) は最適か?
  • RQ3マルチアームバンディットの原則は、統計的妥当性を損なわずにモンテカルロパーミュテーション検定の計算を加速するために効果的に適用可能か?
  • RQ4大規模な仮説検定において、全サンプリングコストを最小限に抑えつつ、fMC結果の高確率回復をどのように保証できるか?

主な発見

  • AMTは、全MCサンプル数をnmから Õ(√n m) に削減し、フルモンテカルロ結果を回復するための証明可能な最適サンプル複雑度を達成した。
  • m ≈ 10^6のSNPと1テストあたりn ≈ 10^8のサンプルを持つパーキンソン病のGWASデータセットにおいて、AMTは実行時を2か月から約1時間に短縮した。
  • アルゴリズムは、高確率でフルモンテカルロアプローチと同一の発見集合を回復し、統計的整合性を保証した。
  • 理論的解析により、p値の分散が有界であるという仮定の下で、Õ(√n m) がこの回復タスクにおける最適サンプル複雑度であることが証明された。
  • 尤度比解析により、任意の代替仮説下での誤差確率が0から離れていることが示され、δ ≤ c8/8 に対してδ-correctなアルゴリズムが不可能であることが証明され、根本的な下界が確立された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。