[論文レビュー] Selection by Prediction with Conformal p-values
本稿では、適合p値と多重仮説検定手順を用いて、未観測の結果が高く、かつ発見誤り率(FDR)を制御する候補者選定手法cfBHを提案する。予測モデルからp値を構築し、しきい値に基づく選定を施すことで、わずかな交換可能性の仮定のもとでも、期待される誤り発見の割合がユーザーが指定した水準以下に保たれることを保証する。実世界の採用および創薬の設定において、経験的妥当性が確認された。
Decision making or scientific discovery pipelines such as job hiring and drug discovery often involve multiple stages: before any resource-intensive step, there is often an initial screening that uses predictions from a machine learning model to shortlist a few candidates from a large pool. We study screening procedures that aim to select candidates whose unobserved outcomes exceed user-specified values. We develop a method that wraps around any prediction model to produce a subset of candidates while controlling the proportion of falsely selected units. Building upon the conformal inference framework, our method first constructs p-values that quantify the statistical evidence for large outcomes; it then determines the shortlist by comparing the p-values to a threshold introduced in the multiple testing literature. In many cases, the procedure selects candidates whose predictions are above a data-dependent threshold. Our theoretical guarantee holds under mild exchangeability conditions on the samples, generalizing existing results on multiple conformal p-values. We demonstrate the empirical performance of our method via simulations, and apply it to job hiring and drug discovery datasets.
研究の動機と目的
- 未観測の結果がユーザーが定めたしきい値を上回る候補者を選定しつつ、発見誤り率(FDR)を制御する手法を開発すること。
- 独立同一分布(i.i.d.)のサンプリングではなく、交換可能性の仮定のみを前提とした最小限の分布的仮定のもとでFDR制御を保証すること。
- 適合推論と多重仮説検定手順を統合し、高利害なスクリーニングプロセスにおける信頼性の高い、データ駆動型の選定を実現すること。
- 本手法の経験的性能を、採用および創薬の分野における実世界のデータセットを用いて示すこと。
提案手法
- 各テストサンプルについて、その結果がユーザーが指定したしきい値を上回るという統計的証拠を測定することで、適合p値を構築する。
- キャリブレーションセットを用いて非適合スコアを計算し、これは与えられた結果が訓練データに対してどれほど極端であるかを定量化する。
- 計算されたp値にBenjamini-Hochberg手順(BH)を適用し、事前に指定された水準でFDRを制御するための棄却しきい値を決定する。
- p値がBHのしきい値未満であるすべてのテストユニットを選定することで、交換可能性のもとでFDR制御を保証する。
- ロバストネスとパワーの評価のため、2種類の非適合スコア(残差偏差に基づくBH_res、クリッピング済み偏差に基づくBH_clip)を用いる。
- 創薬分野における分位数ベースのしきい値など、各サンプルごとに異なるしきい値を適用するデータセットに本手法を適用し、結果の非均一性に対処する。
実験結果
リサーチクエスチョン
- RQ1予測モデルを統計的枠組みで包み込むことで、高利害な意思決定における候補者選定におけるFDR制御を達成できるか?
- RQ2適合推論は、創薬分野における分位数ベースのカットオフのような、テストサンプルごとに異なるしきい値に対応できるか?
- RQ3提案手法の経験的性能は、採用およびバーチャル創薬スクリーニングなどの実世界のスクリーニングタスクにおいてどのように現れるか?
- RQ4非適合スコアの選択が、選定手順のパワーと安定性にどのように影響するか?
- RQ5分布的シフトやi.i.d.のサンプリングからの逸脱が生じた場合、本手法はどの程度有効性を保つのか?
主な発見
- cfBH手法は、すべてのテスト設定において名目水準でFDRを制御しており、経験的FDP値はターゲットの有意水準(q ∈ {0.1, 0.2, 0.5})に近く、良好な性能を示した。
- q = 0.1の条件下で、BH_clipはBH_resよりも高い統計的パワーとより大きな選定集合を達成しており、特に低FDR水準で顕著であった。
- q = 0.1の場合、BH_resは名目水準未満のFDPを示し、パワーが低いため保守的であることが示されたのに対し、BH_clipは名目水準に近いFDPを維持した。
- 母集団分位数しきい値(q_pop)が上昇するにつれて、両手法ともパワーが低下したが、これはより高い結果しきい値を要するため予想された結果であった。
- 本手法は、さまざまなデータ分布やしきい値タイプ(創薬分野におけるターゲット固有の分位数しきい値など)に対してもロバストである。
- 本手法はi.i.d.仮定を超えて一般化可能であり、やや弱い交換可能性の条件下でもFDR制御を維持するため、実世界のスクリーニングパイプラインへの応用範囲が広がる。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。