[論文レビュー] False Discovery Rate Control Under General Dependence By Symmetrized Data Aggregation
本稿では、一般の従属構造下での誤り発見率(FDR)制御を目的として、分布フリーな多重仮説検定手順である対称化データ集約(SDA)を提案する。サンプル分割、データスクリーニング、情報プーリングを活用することで、SDAは対称的なランク統計量とデータ駆動型のしきい値を構築し、従来の手法(例:ノックオフスやBH)と比較して、中程度から強い従属性下でも、より高いパワーと高いロバストネスを実現するFDR制御を達成する。
We develop a new class of distribution-free multiple testing rules for false discovery rate (FDR) control under general dependence. A key element in our proposal is a symmetrized data aggregation (SDA) approach to incorporating the dependence structure via sample splitting, data screening, and information pooling. The proposed SDA filter first constructs a sequence of ranking statistics that fulfill global symmetry properties, and then chooses a data-driven threshold along the ranking to control the FDR. The SDA filter substantially outperforms the Knockoff method in power under moderate to strong dependence, and is more robust than existing methods based on asymptotic <i>p</i>-values. We first develop finite-sample theories to provide an upper bound for the actual FDR under general dependence, and then establish the asymptotic validity of SDA for both the FDR and false discovery proportion control under mild regularity conditions. The procedure is implemented in the R package sdafilter. Numerical results confirm the effectiveness and robustness of SDA in FDR control and show that it achieves substantial power gain over existing methods in many settings.
研究の動機と目的
- 一般の従属構造下での多重仮説検定における、ロバストで分布フリーなFDR制御手法の開発。
- 独立性を仮定するか、漸近的近似に依存する既存のFDR手順(例:BH や ノックオフス)の限界を克服すること。
- 非パラメトリックでデータ駆動型のアプローチにより、従属情報を統合し、強いパラメトリック仮定を必要とせずに統計的パワーを向上させること。
- ややきつい正則性条件の下で、有限標本および漸近的理論的保証(FDRおよび誤り発見数割合(FDP)の制御)を確立すること。
- ゲノム学やその他の高次元設定における実世界応用を想定し、Rパッケージ sdafilter を通じた実用的実装を提供すること。
提案手法
- データをトレーニングおよびバリデーションの2セットに分割することで、両スプリット間での検定統計量の対称性を実現する。
- 両データスプリットからの検定統計量の平均をとることで、対称的なランク統計量を構築し、グローバルな対称性を確保することでロバストネスを向上させる。
- 情報プールの前段階として、弱い信号をフィルタリングしノイズを低減するためのデータスクリーニングを適用する。
- 複数のスプリットにわたる情報を統合することで、信号対ノイズ比を向上させ、FDR推定の安定性を高める。
- 対称化統計量のランク順に沿ったデータ駆動型しきい値を選択し、名目水準でのFDR制御を達成する。
- 漸近的正規性やパラメトリックモデルに依存しない非パラメトリックな誤り発見数割合(FDP)推定を採用する。
実験結果
リサーチクエスチョン
- RQ1独立性を仮定せず、漸近的正規性にも依存しない条件下で、FDR制御を達成できるか?
- RQ2従属構造を効果的に活用することで、多重仮説検定における統計的パワーをどのように向上させられるか?
- RQ3有限標本下でのFDR制御の挙動はどのように振る舞い、厳密に境界を定められるか?
- RQ4中程度から強い従属性下において、SDAはノックオフスやBH手順と比較して、パワーとロバストネスの面で優れているか?
- RQ5ややきつい正則性条件下で、非パラメトリックでデータ駆動型のアプローチが、FDRおよびFDP制御の両面で漸近的妥当性を達成できるか?
主な発見
- SDAフィルタは、任意の従属構造下で有限標本におけるFDR制御を達成でき、中程度の偏差理論を用いて実際のFDRの上界が確立された。
- 特に高次元設定下では、中程度から強い従属性下で、ノックオフス手法と比較してSDAが顕著に高いパワーを示した。
- 繰り返しデータ分割を用いるR-SDAバージョンは、単一分割のSDAと比較して、FDPおよびAP推定のばらつきが低く、より安定した性能を示した。
- サンプルサイズや検定数の変動に対しても、SDAはFDR制御を正確に維持した。共分散行列の推定が行われても同様に、小標本領域ではPFAやDATEを上回った。
- B線球系ALLの遺伝子発現データ解析の実データ分析では、SDAはBH、SS、PFA、DATEと比較して、より一貫性があり高いパワーを示し、19個の有意に発現差を示すプローブセットを同定した。
- 数値結果から、SDAは正規性の破れやモデル不適合に対してもロバストであることが確認され、従属構造にかかわらずFDR制御が名目水準に近く維持された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。