[論文レビュー] Adjusting for selection bias in testing multiple families of hypotheses
本稿では、複数の仮説検定において、個々の検定の前にデータに基づいて仮説のグループ(ファミリー)が選択される状況における選択バイアスを補正する一般化された手法を提案する。この手法は、各選択済みファミリー内で有意水準を調整することで、選択後の誤差率制御を達成するデータ駆動型のしきい値設定手順を導入し、FWER、FDR、一般化誤差率を含む広範な誤差率クラスにおいて、選択後も誤差率が制御されることを保証する。
In many large multiple testing problems the hypotheses are divided into families. Given the data, families with evidence for true discoveries are selected, and hypotheses within them are tested. Neither controlling the error-rate in each family separately nor controlling the error-rate over all hypotheses together can assure that an error-rate is controlled in the selected families. We formulate this concern about selective inference in its generality, for a very wide class of error-rates and for any selection criterion, and present an adjustment of the testing level inside the selected families that retains the average error-rate over the selected families.
研究の動機と目的
- 個々の検定の前にデータに基づいて選択される仮説のファミリーが存在する多重検定における選択バイアスの課題に対処すること。
- FWER、FDR、一般化誤差率を含む広範な誤差率クラスに適用可能な一般化された枠組みにおいて、選択的推論(selective inference)の問題を定式化すること。
- 選択が事前に指定されておらずデータ駆動的である場合でも、選択されたファミリーにおける平均誤差率を制御する手法を提供すること。
- 誤差率制御がすべてのファミリー全体に対してのみではなく、選択後の条件付きに選択されたファミリー内でも維持されることを保証すること。
提案手法
- 誤差率をランダム誤差測度の期待値 $ E(\mathcal{C}) $ として定式化し、FWER、FDR、FDX、$k$-FWER/$k$-FDRをカバーする。
- すべてのファミリーにわたるp値の順序統計量から導かれる臨界値を用いて、各選択済みファミリー内で有意水準をデータ駆動的に調整する。
- 選択と検定の間の依存性をモデル化するため、ファミリー $i$ における $k$ 番目の棄却とp値分布における $r_i$ 番目の順序統計量を表す合同事象 $ C_k^{(i)} \cap B_{r_i}^{(ij)}[k] $ を定義する。
- 真の帰無仮説下でのp値に正の回帰的依存性(PRDS)を仮定し、条件付き確率の確率的単調性を確立する。
- ファミリーおよびp値 across における累積的棄却パターンを表すイベント $ A_s^{(ij)} $ の和集合を構成し、誤差確率の再帰的バウンディングを可能にする。
- 臨界しきい値上での条件付き確率の和が1以下に抑えられることを示し、帰納法および単調性の議論を用いて、全体の誤差率がレベル $ q $ で制御されることを証明する。
実験結果
リサーチクエスチョン
- RQ1選択ルールが検定に用いられる同一のデータに依存する場合でも、選択されたファミリーにおける誤差率制御を維持することは可能か?
- RQ2ファミリーが発見の証拠に基づいて選択される場合でも、選択されたファミリー内で有意水準を調整することで、平均誤差率を維持することは可能か?
- RQ3選択的推論の文脈において、一般化誤差率クラス $ E(\mathcal{C}) $ をどのように制御できるか?
- RQ4特にPRDS仮定下で、データに依存する選択後のテストしきい値の調整の理論的基盤は何か?
- RQ5本手法は、fMRI や GWAS 研究におけるような複雑な階層的または多要因的検定構造に対しても拡張可能か?
主な発見
- 提案手法は、選択がデータ駆動的基準に基づく場合でさえ、選択されたファミリーにおける平均誤差率を適切に制御することに成功した。
- 各選択ファミリー内で有意水準を調整することにより、選択バイアスが存在しても期待誤差測度 $ E(\mathcal{C}) $ が名目水準 $ q $ 以下に保たれることを保証する。
- 本手法は、ガウス分布やパーミュテーションベースのモデルなど多くの実用的状況で成り立つp値のPRDS仮定のもとで有効である。
- 確率的単調性の下で成り立つ条件付き棄却事象の再帰的不等式に依拠した証明が行われ、その有効性が裏付けられた。
- 全体の誤差制御を保証するバウンディング $ \sum_{t=1}^{mm_i} \sum_{(k,r_i)\in I_t} \text{Pr}(C_k^{(i)}, B_{r_i}^{(ij)}[k] \mid P_{ij} \leq tq/(mm_i)) \leq 1 $ が確立された。
- FWER、FDR、FDX、$k$-FWERを含む広範な誤差率クラスに一般化可能であり、統計的仮説検定フレームワーク全体に広く適用可能である。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。