Skip to main content
QUICK REVIEW

[論文レビュー] Estimating the number and effect sizes of non-null hypotheses

Jennifer Brennan, Ramya Korlakai Vinayak|arXiv (Cornell University)|Feb 17, 2020
Statistical Methods in Clinical Trials参考文献 36被引用数 4
ひとこと要約

この論文は、最小限のパイロット実験を用いて、多重仮説検定設定における非ノンブル仮説の数と効果量の推定に計算的に効率的で、保守的な推定量を提案する。$ε$-ボールを経験的CDFの周囲に用い、しきい値 $\gamma$ より上の質量を最小化することで、高い確率で発見数を保守的に推定する。これにより、完全な実験に比べてはるかに少ない標本数で最適な実験設計が可能になる。

ABSTRACT

We study the problem of estimating the distribution of effect sizes (the mean of the test statistic under the alternate hypothesis) in a multiple testing setting. Knowing this distribution allows us to calculate the power (type II error) of any experimental design. We show that it is possible to estimate this distribution using an inexpensive pilot experiment, which takes significantly fewer samples than would be required by an experiment that identified the discoveries. Our estimator can be used to guarantee the number of discoveries that will be made using a given experimental design in a future experiment. We prove that this simple and computationally efficient estimator enjoys a number of favorable theoretical properties, and demonstrate its effectiveness on data from a gene knockout experiment on influenza inhibition in Drosophila.

研究の動機と目的

  • 効果量が未知である場合に、統計的パワーが保証される実験設計の課題に対処すること。
  • 小さな安価なパイロットスタディを用いて、複数の仮説における効果量の分布を推定すること。
  • 与えられた効果量しきい値より高い発見数を、決して過剰に推定しない保守的推定量を提供すること。
  • 理論的保証を用いて、コスト(再現回数)と発見量のトレードオフを実験設計に組み込むこと。
  • 実世界の応用(遺伝子ノックアウト研究など)において、計算的に効率的で統計的に頑健な手法を開発すること。

提案手法

  • 推定量は、検定統計量の経験的累積分布関数(CDF)の周囲に $\ell_\infty$ ボールを構築し、妥当な分布の集合を定義する。
  • 与えられたしきい値 $\gamma$ より上の確率質量を最小化する分布を同定することで、保守的な推定を保証する。
  • 単位区間における二分探索を用いて、下限推定値 $\widehat{\zeta}_n(\gamma)$ を計算し、各ステップで仮説検定を実施して質量しきい値を検証する。
  • 凸最適化(CVXPYとECOSを介して)を用いて、制約付き最小化問題を効率的に解く。
  • 推定量は $\widehat{\zeta}_n(\gamma) \leq \zeta_{\nu_*}(\gamma)$ を高い確率で満たすように設計されており、発見数の過剰推定を回避する。
  • 正規、ポアソン、二項分布の検定統計量に適用し、実ドロソフィラインfluenza遺伝子ノックアウトデータを用いて検証した。

実験結果

リサーチクエスチョン

  • RQ1完全な発見に必要な標本数よりも著しく少ない標本数で、しきい値 $\gamma$ より高い効果量を持つ非ノンブル仮説の数を推定できるか?
  • RQ2計算的に効率的でありながら、発見数を決して過剰に推定しない保守的推定量をどのように設計できるか?
  • RQ3有限標本における推定量の精度について、どのような理論的保証を提供できるか?
  • RQ4推定値の保守性と精度の観点で、プラグイン法や他のベースライン手法と比較してどうなるか?
  • RQ5推定量は、コスト(再現回数)と発見量のバランスを取る実験設計を支援できるか?

主な発見

  • 提案された推定量は、しきい値 $\gamma$ より高い仮説の割合について、有限標本における上界と下界を提供し、統計的信頼性を保証する。
  • 推定量は証明可能な保守性を持つ:標本サイズが増加するにつれて $\mathbb{P}(\widehat{\zeta}_n(\gamma) > \zeta_{\nu_*}(\gamma)) \to 0$ となるため、発見数の過剰推定が保証されない。
  • 標本サイズ $n$ が増加するにつれて、ベースライン手法とは異なり、本手法はより高い精度を達成する。
  • $n=100,000$ のシミュレーションでは、信号対雑音比が低い状況下でも、真の $\zeta_*$ を過剰に推定せずに正確に追跡した。
  • 理論的分析により、範囲 $A_\varepsilon$ で精度 $\varepsilon$ を達成する任意の推定量は、少なくとも $n \gtrsim 1/(\varepsilon^2 \gamma_*^4)$ の標本数を要することが示され、標本複雑度の下界が確立された。
  • 本手法は、ドロソフィラ遺伝子ノックアウト実験の実データに成功裏に適用され、実験設計における実用的有用性が示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。