[論文レビュー] Estimation of False Discovery Proportion with Unknown Dependence
本稿は、検定統計量が依存的でかつ共分散行列が未知である場合の、大規模な多重仮説検定における偽発見数割合(FDP)の推定について、理論的裏付けのある枠組みを構築する。特に、スパースまたは要因ベースの依存構造の下で固有値/固有ベクトルの推定を活用し、POET推定量を用いることで、真の依存構造が未知であってもFDPを一貫して近似可能であることを確立する。これにより、共分散行列が既知であると仮定していた先行研究を拡張する。
Large-scale multiple testing with highly correlated test statistics arises frequently in many scientific research. Incorporating correlation information in estimating false discovery proportion has attracted increasing attention in recent years. When the covariance matrix of test statistics is known, Fan, Han & Gu (2012) provided a consistent estimate of False Discovery Proportion (FDP) under arbitrary dependence structure. However, the covariance matrix is often unknown in many applications and such dependence information has to be estimated before estimating FDP (Efron, 2010). The estimation accuracy can greatly affect the convergence result of FDP or even violate its consistency. In the current paper, we provide methodological modification and theoretical investigations for estimation of FDP with unknown covariance. First we develop requirements for estimates of eigenvalues and eigenvectors such that we can obtain a consistent estimate of FDP. Secondly we give conditions on the dependence structures such that the estimate of FDP is consistent. Such dependence structures include sparse covariance matrices, which have been popularly considered in the contemporary random matrix theory. When data are sampled from an approximate factor model, which encompasses most practical situations, we provide a consistent estimate of FDP via exploiting this specific dependence structure. The results are further demonstrated by simulation studies and some real data applications.
研究の動機と目的
- 検定統計量の共分散行列が未知である場合の偽発見数割合(FDP)推定の課題に取り組むこと。これは高次元多重仮説検定において一般的な問題である。
- 未知の依存構造下で固有値および固有ベクトルの推定がFDP近似精度に与える影響を形式的に分析すること。
- スパース、バンド型、または近似因子モデルの共分散構造の下で、FDP推定の一貫性を保証する一般枠組みを構築すること。
- 多変量正規性を越えて、より一般的な依存仮定に一般化すること。
- 未知の依存構造下でFDP推定にPOET推定量を理論的に正当化すること。また、シミュレーションおよび実データを用いて有限標本性能を検証すること。
提案手法
- 共分散行列の固有構造(固有値および固有ベクトル)を推定することで、未知の依存構造を考慮したFDP推定の一般枠組みを提案する。
- 高次元的依存をモデル化するため、POET(主成分直交補完チューニング)法を用いて推定共分散行列の固有分解を適用する。
- 推定された固有値および固有ベクトルが、スパarsityまたは因子モデル仮定の下で一貫したFDP近似をもたらす理論的条件を確立する。
- FDP推定量の非漸近的誤差バウンドを導出し、推定誤差が $ O_p(p^ heta (k( ho_n + m_p ho_n^{1-q} p^{-1}) + mu^* p^{-1/2})) $ のオーダーであることを示す。ここで $ \rho_n $ は推定誤差を制御する。
- Weylの定理および $ \sin \theta $ 定理を用いて、推定誤差に起因する固有値および固有ベクトルの摂動をバウンドする。
- 多変量正規分布および非正規誤差分布の両方の下で手法を検証し、分布指定の誤りに対して頑健であることを示す。
実験結果
リサーチクエスチョン
- RQ1未知の依存構造、特に共分散行列の推定が必要な状況が、偽発見数割合(FDP)推定の精度にどのように影響するか。
- RQ2共分散行列構造(例えばスパース、バンド型、因子モデル)にどのような条件が、共分散が未知である場合のFDP推定の一貫性を保証するか。
- RQ3未知の依存構造下でPOET推定量がFDP推定に理論的に正当化可能か。また、そのFDP推定量の収束速度はいかほどか。
- RQ4標本分散および固有構造の推定誤差が、高次元多重仮説検定におけるFDP近似にどのように共同で影響を与えるか。
- RQ5この枠組みは、検定統計量の多変量正規性を越えてどの程度一般化可能か。
主な発見
- 本稿は、真の共分散行列が未知であっても、POETによる共分散行列の固有構造推定が可能な限り、FDPを一貫して推定可能であることを確立した。
- FDP推定量の推定誤差は $ O_p(p^ heta (k( ho_n + m_p ho_n^{1-q} p^{-1}) + mu^* p^{-1/2})) $ でバウンドされ、ここで $ \rho_n $ は固有値および固有ベクトルの推定誤差を捉える。
- 近似因子モデルの下では、POET手順による固有値および固有ベクトルの推定誤差が制御され、FDP近似が一貫して達成される。
- 理論的結果は、多変量正規性仮定を緩和してもFDP推定量が一貫性を保つことを示し、頑健性を示している。
- シミュレーション研究および実データ応用により、本手法が現実的な依存構造下でFDPを適切に制御する実用的有効性が確認された。
- 本枠組みは、先行研究が既知または誤った依存構造を仮定していたという限界を解消し、固有構造に基づく手法のFDP推定への理論的正当化を提供する。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。