[論文レビュー] Model Selection and Multiple Testing - A Bayesian and Empirical Bayes Overview and some New Results
本稿は、モデル選択と多重仮説検定に関する包括的なベイズおよび経験ベイズの概説を提供し、高次元設定における新しい一貫性の定義を導入し、パラメータ数が標本サイズより遅く増加する場合に、不適切な事前分布を正則化するために僅かに僅かな部分を除き、すべてのデータを推論に使用することが一貫性を最適化することを確立している。主な貢献は、高次元ベイズモデル選択におけるデータ分割戦略の理論的裏付けを提供することにある。
We provide a brief overview of both Bayes and classical model selection. We argue tentatively that model selection has at least two major goals, that of finding the correct model or predicting well, and that in general both these goals may not be achieved in an optimum manner by a single model selection rule. We discuss, briefly but critically, through a study of well-known model selection rules like AIC, BIC, DIC and Lasso, how these different goals are pursued in each paradigm. We introduce some new definitions of consistency, results and conjectures about consistency in high dimensional model selection problems. Finally we discuss some new or recent results in Full Bayes and Empirical Bayes multiple testing, and cross-validation. We show that when the number of parameters tends to infinity at a smaller rate than sample size, then it is best from the point of view of consistency to use most of the data for inference and only a negligible proportion to make an improper prior proper.
研究の動機と目的
- モデル選択における正しいモデル同一定と最適な予測の二重の目的を調和させること、特に高次元設定において。
- AIC、BIC、DIC、Lasso などの既存のモデル選択ルールにおける一貫性の欠如を是正するため、ベイズおよび経験ベイズ枠組みの下でそれらの理論的基盤を再評価すること。
- 遺伝学的応用など、実世界の状況(例:ゲノム研究)をよりよく反映する高次元モデル選択のための、より実用的な一貫性の定義を提案すること。
- 交差検証と交差検証ベイズ因子が、パラメータ数が標本サイズとともに増加する場合にモデル選択の一貫性をどのように向上させるかを調査すること。
- ゲノムワイド関連解析(GWAS)で見られるような高次元かつ複雑なデータ構造に対応するように、経験ベイズおよび多重仮説検定の手法を拡張すること。
提案手法
- 古典的一貫性の厳密な要件を緩和する高次元モデル選択における一貫性の新しい定義を提案し、多くの弱い信号を伴う現代のデータにさらに適用可能にする。
- ペナルティ付き尤度とオラクルリスクバウンドの概念を用いて、AIC や BIC などの古典的基準を評価・比較し、特定の条件下で AIC が予測において最適であり、BIC がモデル選択において最適であることを示す。
- パラメータ数が標本サイズより遅く増加するという仮定の下で、不適切な事前分布を正則化するために僅かに僅かなデータのみを用い、残りのデータを推論に使用するデータ分割戦略を導入する。
- 大偏差理論と漸近的理論を用いて、このデータ分割戦略がモデル選択の一貫性を保証する理論的条件を導出する。
- 交差検証ベイズ因子(CVBF)を分析し、正則性条件下では標準ベイズ因子と漸近的に同等であるが、その設計上、有限標本では異なるモデル選択をもたらす可能性があることを示す。
- 多重仮説検定問題に経験ベイズ手法を適用し、特に順序付けられたまたはトレンドのあるデータの文脈で議論し、方向的多重仮説検定への拡張と混合方向的FDR制御について考察する。
実験結果
リサーチクエスチョン
- RQ1パラメータ数が標本サイズとともに増加する場合、正しいモデル同一定と最適な予測という二つの目的が衝突する状況で、モデル選択ルールはどのように評価できるか?
- RQ2パラメータ数が標本サイズとともに増加する高次元設定において、より適切で証明可能な一貫性の新しい定義は何か?
- RQ3高次元ベイズモデル選択において、推論にほぼすべてのデータを使用し、不適切な事前分布を正則化するために僅かに僅かな部分を除き、それが最適となる条件は何か?
- RQ4有限標本におけるモデル選択において、交差検証ベイズ因子(CVBF)は標準ベイズ因子とどのように異なるか?その一貫性への影響は何か?
- RQ5経験ベイズおよび多重仮説検定フレームワークは、方向的誤差制御を伴う高次元設定における順序付けられたまたはトレンドのある実験的条件を扱うように拡張可能か?
主な発見
- パラメータ数が標本サイズより遅く増加する場合、不適切な事前分布を正則化するために僅かに僅かな部分を除き、すべてのデータを推論に使用することが一貫性を確保する上で最適である。
- 本稿で提案された高次元モデル選択における一貫性の新しい定義は、古典的一貫性の定義よりも実用的で、証明が容易である。特に、多くの弱い信号を伴う設定において顕著である。
- 交差検証ベイズ因子(CVBF)は、正則性条件下では標準ベイズ因子と漸近的に同等であることが示されたが、有限標本では異なるモデル選択をもたらす可能性がある。
- シミュレーション研究によると、真の回帰子が多数存在する(例:40個)GWASに類似した設定では、SIS(Sure Independence Screening)手順が誤った相関から失敗する可能性がある。
- 多くの弱い信号(多因子的効果)を伴う高次元設定では、強い個別遺伝子を同定するには、その遺伝子の効果がすべての多因子的成分の要約効果を上回っている必要があることが示され、識別可能性の重要な条件が明らかになった。
- 特に順序付けられたまたはトレンドのあるデータにおける多重仮説検定の経験ベイズフレームワークは、方向的誤差制御を用いて拡張可能であるが、このような多次元問題に対して完全なベイズ的解決策はまだ存在しない。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。