[論文レビュー] Generalized estimators for multiple testing: proportion of true nulls and false discovery rate
本稿では、帰無仮説の真の割合および多重仮説検定手順における誤り発見率(FDR)の一般化推定量を提案し、帰無分布が一様分布を支配する離散的p値に対応するように先行研究を拡張する。FDR推定量は、従属性が存在しても、同時に漸近的に保守的であり、停止時刻の性質を有することが示され、次世代シークエンシングデータにおける実証的結果から、競合手法よりも優れた性能を示している。
Summary. Two new estimators are proposed: the first for the proportion of true null hypotheses and the second for the false discovery rate (FDR) of one-step multiple testing procedures (MTPs). They generalize similar estimators developed jointly by Storey, Taylor and Siegmund and can be applied also to discrete p-values whose null distributions dominate the uniform distribution. For the new estimator of the FDR, we establish its simultaneous asymptotic conservativeness and justify formally the stopping time property of its threshold for p-values not necessarily independent or continuous. Our empirical studies show that, when applied to the aforementioned p-values, both of our estimators usually outperform their competitors (considered in this work) except that the first one may under-estimate the target when the needed tuning parameters are inappropriately chosen. The methodology of our work easily extends to other types of discrete p-values. We illustrate the improvement in power our estimators can induce by applying them to next-generation sequencing count data.
研究の動機と目的
- 帰無分布が一様分布を支配する離散的p値に適用可能な、真の帰無仮説の割合およびFDRの推定量を開発すること。
- ストアー、テイラー、シーゲンブの既存の推定量を、より広いクラスの離散的p値に拡張すること。
- 従属性が存在する状況下でも、FDR推定量の同時漸近的保守性および停止時刻の性質といった理論的性質を確立すること。
- 特に次世代シークエンシングカウントデータにおいて、より高い統計的検出力と正確性を示す実世界の応用を実証すること。
- 現在の範囲を超えて他の種類の離散的p値に対しても一般化可能な柔軟なフレームワークを提供すること。
提案手法
- チューニングパラメータを用いて離散的p値への感受性を制御する一般化推定量を、真の帰無仮説の割合の推定に提案する。
- 複数の仮説検定手順において、漸近的に保守的であることを保証する新しいFDR推定量を導入する。
- p値に基づくしきい値処理を適用し、p値が従属的または非連続であっても、停止時刻の性質を尊重する。
- 推定量の妥当性を裏付けるために、離散的p値の帰無分布における支配条件(一様分布を支配する)を用いる。
- シミュレーションおよび実際の次世代シークエンシングデータを用いた実証的評価を通じて、既存の競合手法との性能を比較する。
- 分布的支配に基づく一般化フレームワークを用いて、他の離散的p値の族への手法の拡張を実施する。
実験結果
リサーチクエスチョン
- RQ1帰無分布が一様分布を支配する離散的p値の設定において、真の帰無仮説の割合をより正確に推定できるか?
- RQ2提案されたFDR推定量は、従属性や非連続p値が存在する状況でも、保守的かつ有効性を保つのか?
- RQ3特にシークエンシングデータにおいて、新しい推定量はバイアスおよび検出力の観点で、既存の競合手法と比較してどのように性能を発揮するか?
- RQ4離散的データを伴う多重仮説検定の状況において、新しい推定量は統計的検出力をどの程度向上できるか?
- RQ5現在の応用範囲を超えて、他の種類の離散的p値に対しても、この手法的フレームワークを一般化できるか?
主な発見
- 提案された真の帰無仮説の割合の推定量は、一般に競合手法を上回るが、チューニングパラメータが不適切に選ばれた場合には、ターゲットを低めに推定する可能性がある。
- FDR推定量は、期待される誤り発見割合の制御を保証する、同時に漸近的に保守的である。
- p値が従属的または非連続であっても、しきい値の停止時刻の性質を示すため、逐次的検定への応用が正当化される。
- 次世代シークエンシングデータにおける実証的結果から、新しい推定量が統計的検出力の有意な向上をもたらすことが示された。
- この手法は、帰無分布が一様分布を支配する他の離散的p値の族に対しても、頑健かつ拡張可能である。
- 特に離散的かつ従属的なp値を伴う状況において、有限標本での推定量は優れた性能を示す。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。