[論文レビュー] Control of the False Discovery Rate Under Arbitrary Covariance Dependence
本稿では、共分散行列の固有値分解を用いて強力な共通要因を除去することにより、任意の従属構造下での高次元多重仮説検定における誤り発見率(FDR)を制御するための主因子近似(PFA)手法を提案する。この手法により、誤り発見率割合(FDP)の一貫した推定が可能となり、相関のある検定統計量下でエフロンの手法よりも優れる。
Multiple hypothesis testing is a fundamental problem in high dimensional inference, with wide applications in many scientific fields. In genome-wide association studies, tens of thousands of tests are performed simultaneously to find if any genes are associated with some traits and those tests are correlated. When test statistics are correlated, false discovery control becomes very challenging under arbitrary dependence. In the current paper, we propose a new methodology based on principal factor approximation, which successfully substracts the common dependence and weakens significantly the correlation structure, to deal with an arbitrary dependence structure. We derive the theoretical distribution for false discovery proportion (FDP) in large scale multiple testing when a common threshold is used and provide a consistent FDP. This result has important applications in controlling FDR and FDP. Our estimate of FDP compares favorably with Efron (2007)'s approach, as demonstrated by in the simulated examples. Our approach is further illustrated by some real data applications.
研究の動機と目的
- 検定統計量が任意の従属構造を示す場合のFDR制御の課題に対処すること。これは高次元推論において一般的な問題である。
- 独立性や特定の従属構造を仮定するのではなく、共分散情報を完全に組み込む手法の開発。
- 一般従属構造下での誤り発見率割合(FDP)の一貫した推定量の導出。これにより、信頼性のあるFDR制御が可能となる。
- 高相関下で精度を失う既存のFDR手順(ベンジャミニ=ホッコーバーやストアーズの手法など)を改善すること。
- 理論的裏付けが強く、スケーラブルなソリューションを提供し、遺伝学的連関研究(GWAS)などの実世界問題に適用可能であること。
提案手法
- 既知の共分散行列 $\Sigma$ の固有値分解を用いて、検定統計量間の強い従属構造を引き起こす主因子を抽出する。
- 主因子近似(PFA)を適用して支配的共通因子を除去することで、全体の従属構造を弱める。
- 因子除去後の残存弱従属を考慮した、大規模な $p$ における誤り発見率割合(FDP)の漸近的分布を導出する。
- 閾値ベースの手順を採用し、$\widehat{\text{FDR}}(t) = \widehat{p}_0 t / (R(t) \vee 1)$ を用いる。$\widehat{\text{FDR}}(t) \leq \alpha$ を満たす $t$ を解く。ここで $\widehat{p}_0$ はデータから推定される。
- FDP推定における尾確率のモデル化に、正規累積分布関数 $\Phi$ と標準正規密度 $\phi$ を用い、推定された因子負荷と重みを組み込む。
- コーシー=シュワルツの不等式と集中不等式を用いて、固有値および因子負荷に関する正則性条件下でFDP推定量の漸近的一貫性を確立する。
実験結果
リサーチクエスチョン
- RQ1検定統計量が高相関を含む任意の従属構造を示す場合でも、FDRを一貫して制御できるか?
- RQ2高次元データにおける共通の従属構造を効果的に除去することで、FDR推定をどのように改善できるか?
- RQ3一般従属構造下での誤り発見率割合(FDP)の理論的分布は何か? また、その一貫した推定は可能か?
- RQ4相関のある検定統計量下で、提案されたPFA手法はエフロン(2007)の経験ベイズ的手法と比べてどのように性能を発揮するか?
- RQ5遺伝学的連関研究(GWAS)などの実世界応用において、本手法はパワーと精度をどの程度維持できるか?
主な発見
- 提案されたPFA手法は、共分散行列が非自明であっても、任意の従属構造下で誤り発見率割合(FDP)の一貫した推定を達成する。
- 理論的分析により、固有値および因子負荷が有界であるなどの正則性条件下で、FDP推定量が真のFDPに確率的に収束することが示された。
- 特に高相関設定下で、FDR制御が最も損なわれる状況において、シミュレーション例でエフロン(2007)の手法を上回る性能を示した。
- 適切なモーメント条件の下で、FDP推定量が $O_p(\sqrt{k/m})$ 一貫性を示すことが示された。ここで $k$ は因子数、$m$ はサンプルサイズである。
- シミュレーションおよび実データ応用の両方で、検定統計量が高相関であっても、FDRが名目水準 $\alpha$ で制御されていることが確認された。
- 本手法はスケーラブルであり、複雑な従属構造を有する数十万の仮説を同時に検定するGWASなどの大規模問題に適用可能である。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。