[論文レビュー] A leave-p-out based estimation of the proportion of null hypotheses
本稿では、多重仮説検定における真の帰無仮説の割合($\pi_0$)を、強い識別可能性仮定を緩和するための、leave-p-out交差検証を施したヒストグラムベースの推定器を提案する。この手法は、FDR制御手順のパワーを向上させ、FDRを漸近的に制御しつつ、特に$\pi_0$が小さい場合にベンジャミン=ホッジバーグ手順を上回るシミュレーション結果を得る。
In the multiple testing context, a challenging problem is the estimation of the proportion $π_0$ of true-null hypotheses. A large number of estimators of this quantity rely on identifiability assumptions that either appear to be violated on real data, or may be at least relaxed. Under independence, we propose an estimator $\hatπ_0$ based on density estimation using both histograms and cross-validation. Due to the strong connection between the false discovery rate (FDR) and $π_0$, many multiple testing procedures (MTP) designed to control the FDR may be improved by introducing an estimator of $π_0$. We provide an example of such an improvement (plug-in MTP) based on the procedure of Benjamini and Hochberg. Asymptotic optimality results may be derived for both $\hatπ_0$ and the resulting plug-in procedure. The latter ensures the desired asymptotic control of the FDR, while it is more powerful than the BH-procedure. Finally, we compare our estimator of $π_0$ with other widespread estimators in a wide range of simulations. We obtain better results than other tested methods in terms of mean square error (MSE) of the proposed estimator. Finally, both asymptotic optimality results and the interest in tightly estimating $π_0$ are confirmed (empirically) by results obtained with the plug-in MTP.
研究の動機と目的
- 既存の推定器が強い、しばしば破られる識別可能性仮定に依存するため、多重仮説検定の文脈で$\\pi_0$(真の帰無仮説の割合)を推定する課題に対処すること。
- p値が1に近づいて人工的に膨張する現象が実データで観察されるが、そのような状況でも安定に動作する、柔軟で完全に適応的な$\pi_0$推定器を開発すること。
- 正確な$\pi_0$推定値を用いてプラグイン多重仮説検定手順(plug-in MTP)を構築し、FDR制御手順のパワーを向上させるとともに、漸近的FDR制御を保証すること。
- 非正則なヒストグラムとleave-p-out交差検証を用いた、ユーザーが指定する調整パrameterを必要としない、計算効率的で非パラメトリックな$\pi_0$推定アプローチを提供すること。
提案手法
- 本手法は、複雑なp値分布(U字型密度を含む)を柔軟にモデル化できる非正則ヒストグラムを用いてp値の密度を推定する。
- leave-p-out交差検証(LPO)を用いて最適なヒストグラムのビン分割を選び、ユーザー定義パrameterを必要としないデータ駆動型の適応的バンド幅選択を実現する。
- 推定器$\widehat{\pi}_0$は、1に近い領域におけるヒストグラム密度推定に基づき、帰無仮説の下でのp値の割合として導出され、緩い識別可能性仮定の下で定義される。
- ベンジャミン=ホッジバーグ手順における未知の$\pi_0$を$\widehat{\pi}_0$に置き換えることで、プラグイン多重仮説検定手順(plug-in MTP)を構築し、パワーを向上させつつFDR制御を維持する。
- 独立性とややきつい正則性条件の下で、$\widehat{\pi}_0$の漸近的一貫性およびプラグインMTPの漸近的FDR制御が確立される。
- パラメトリックモデルや固定された調整パrameterに依存しないため、1に近い領域での一様性仮定の破れに対しても頑健である。
実験結果
リサーチクエスチョン
- RQ1p値が1に近づいて人工的に膨張するが、標準的な識別可能性仮定を破る状況下でも有効な、非パラメトリックでデータ駆動型の$\pi_0$推定器を開発できるか?
- RQ2固定パラメータ法と比較して、$\pi_0$推定の文脈において、leave-p-out交差検証がより優れた適応的ヒストグラム密度推定法を提供できるか?
- RQ3推定された$\pi_0$を用いたプラグイン多重仮説検定手順が、ベンジャミン=ホッジバーグ手順を上回るパワーを達成できるか、かつ漸近的にFDRを制御できるか?
- RQ4さまざまなシミュレーション状況下で、提案手法の$\pi_0$推定器の平均二乗誤差(MSE)は、既存手法と比較してどのように評価できるか?
- RQ5leave-p-out交差検証において$p > 1$を選択した場合の影響は何か?また、標準的なleave-one-out法と比較して、推定精度が向上するか?
主な発見
- 提案された$\pi_0$推定器は、広範なシミュレーション状況において、他の広く使われている推定器よりも低い平均二乗誤差(MSE)を達成しており、バイアス・バリアンスのトレードオフが優れていることが示された。
- プラグイン多重仮説検定手順(plug-in MTP)は、有限標本においても漸近的FDR制御を実証的に維持していることが示された。
- プラグインMTPは、$\pi_0$が小さい場合に特に、帰無仮説の割合のより正確な推定に起因して、ベンジャミン=ホッジバーグ手順よりも一貫してパワーが高い。
- leave-p-out交差検証(LPO)で$p > 1$を用いることで、leave-one-out(LOO)よりも優れた性能が得られ、LPOは正確に$\pi_0$を知っているオラクル手順にほぼ匹敵するパワーを持つ。
- 多くの既存手法が失敗する「U字型」p値分布の状況でも、推定器はその緩い識別可能性仮定のおかげで頑健である。
- 他の手法とは異なり、ユーザーが指定するパrameterを必要としない完全な適応性を持つ。これに対して、シュベーダーとスプリョトヴァールの推定器は固定された$\lambda$に依存する。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。