[論文レビュー] Inference for the Case Probability in High-dimensional Logistic Regression
本稿は、線形化および分散強化技術を用いて、次元が高次元であるロジスティック回帰における症例確率のバイアス補正推定量を提案する。この推定量の漸近正規性を確立し、サンプルサイズを上回る予測子数がある場合でも、信頼区間および仮説検定による有効な推論を可能にする。
Labeling patients in electronic health records with respect to their statuses of having a disease or condition, i.e. case or control statuses, has increasingly relied on prediction models using high-dimensional variables derived from structured and unstructured electronic health record data. A major hurdle currently is a lack of valid statistical inference methods for the case probability. In this paper, considering high-dimensional sparse logistic regression models for prediction, we propose a novel bias-corrected estimator for the case probability through the development of linearization and variance enhancement techniques. We establish asymptotic normality of the proposed estimator for any loading vector in high dimensions. We construct a confidence interval for the case probability and propose a hypothesis testing procedure for patient case-control labelling. We demonstrate the proposed method via extensive simulation studies and application to real-world electronic health record data.
研究の動機と目的
- 次元が高次元であるEHRベースの予測モデルにおける症例確率のための有効な統計的推論手法の欠如に対処すること。
- p ≫ n の状況において、疾患状態の条件付き確率(症例確率)の信頼性の高い推定量を開発すること。
- 電子健康記録における患者の症例対照ラベリングの仮説検定および信頼区間の構築を可能にすること。
- 関心の関数 h(x*ᵀβ) のための有効な推論を組み込むことで、既存の罰則付き推定法を拡張すること。
- EHRデータを用いた一次アルドステロン症スクリーニング対象患者の同定を含む、臨床的表型化タスクを支援すること。
提案手法
- 推定方程式の線形化を用いて、症例確率 h(x*ᵀβ) のバイアス補正推定量を構築する。
- 高次元設定における推定量の分散を安定化するために、分散強化技術を適用する。
- ランダムなインデックス集合上の経験過程の上界を制御するために、収縮原理と対称化を用いる。
- ラデマッハ複雑度型の議論と部分ガウス型集中を用いて、経験過程項をバインドする。
- 設計行列のスパarsityおよびモーメント条件の下で、推定量の漸近正規性を導出する。
- 推定量の漸近分布に基づいて、信頼区間および仮説検定を構築する。
実験結果
リサーチクエスチョン
- RQ1p ≫ n の場合に、高次元ロジスティック回帰における症例確率 h(x*ᵀβ) に対して有効な統計的推論が可能か?
- RQ2スパースな高次元モデルにおいて、推定された症例確率のバイアスをどのように補正すれば、信頼性の高い推論が可能か?
- RQ3高次元漸近的条件下での症例確率推定量の漸近分布は何か?
- RQ4EHRデータを用いて、患者の症例対照ラベリングのための信頼区間および仮説検定を構築できるか?
- RQ5標準的な罰則付き推定量と比較して、提案手法は有限標本においてどのように性能を発揮するか?
主な発見
- 提案された症例確率のバイアス補正推定量は、高次元漸近的条件下で漸近正規性を満たす。
- この推定量は、高次元において任意の固定されたローディング・ベクトル x* に対して有効な推論を達成する。
- 漸近正規性の仮定の下で、症例確率の信頼区間は正しい被覆率を達成する。
- H₀: h(x*ᵀβ) < 1/2 の仮説検定は有効であり、正しい第一種の誤り率を維持する。
- 広範なシミュレーションおよびペン・メディスンEHRデータへの実世界応用を通じて、この手法のロバスト性が示された。
- スパarsity、部分ガウス型設計、設計行列およびパラメータ・ベクトルの正則性条件の下で、理論的保証が成立する。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。