Skip to main content
QUICK REVIEW

[論文レビュー] Propensity score prediction for electronic healthcare databases using Super Learner and High-dimensional Propensity Score Methods

Cheng Ju, Mary Combs|arXiv (Cornell University)|Mar 7, 2017
Advanced Causal Inference Techniques参考文献 14被引用数 7
ひとこと要約

本研究では、大規模な電子的医療データベースにおける治療割り当ての予測に、Super Learner (SL) と新しい SL-高次元プロピティススコア (hdPS) ハイブリッド手法の有効性を評価する。3つの実世界の請求データセットを用いて、SLは個々のアルゴリズムを適応的に統合することで、予測性能を向上させることを示し、SLとhdPSを組み合わせることで一貫して性能が向上し、薬物疫学におけるプロピティススコア推定に、堅牢でデータに適応したアプローチを提供する。

ABSTRACT

The optimal learner for prediction modeling varies depending on the underlying data-generating distribution. Super Learner (SL) is a generic ensemble learning algorithm that uses cross-validation to select among a "library" of candidate prediction models. The SL is not restricted to a single prediction model, but uses the strengths of a variety of learning algorithms to adapt to different databases. While the SL has been shown to perform well in a number of settings, it has not been thoroughly evaluated in large electronic healthcare databases that are common in pharmacoepidemiology and comparative effectiveness research. In this study, we applied and evaluated the performance of the SL in its ability to predict treatment assignment using three electronic healthcare databases. We considered a library of algorithms that consisted of both nonparametric and parametric models. We also considered a novel strategy for prediction modeling that combines the SL with the high-dimensional propensity score (hdPS) variable selection algorithm. Predictive performance was assessed using three metrics: the negative log-likelihood, area under the curve (AUC), and time complexity. Results showed that the best individual algorithm, in terms of predictive performance, varied across datasets. The SL was able to adapt to the given dataset and optimize predictive performance relative to any individual learner. Combining the SL with the hdPS was the most consistent prediction method and may be promising for PS estimation and prediction modeling in electronic healthcare databases.

研究の動機と目的

  • 大規模な電子的医療データベース内での治療割り当て予測におけるSuper Learner (SL) の性能を評価すること。
  • 高次元プロピティススコア (hdPS) の変数選択手法とSLを組み合わせることで、予測性能が向上するかを評価すること。
  • 予測精度、AUC、計算効率の観点から、SLを個々の機械学習およびパラメトリックモデルと比較すること。
  • データに適応するアンサンブル学習が、複雑で高次元の請求データにおいてモデルの誤指定を克服し、堅牢性を向上させるかを調査すること。

提案手法

  • Super Learner (SL) は、交差検証を用いて指定された損失関数を最小化するように、複数の候補予測モデルを統合するアンサンブル学習アルゴリズムとして用いられる。
  • 候補アルゴリズムのライブラリには、パラメトリック法(例:ロジスティック回帰)と非パラメトリック法(例:勾配ブースティング、ランダムフォレスト、Lasso)が含まれる。
  • 高次元プロピティススコア (hdPS) 法を用いて、高次元の保険請求コードから、情報量の多い請求ベースの共変量の集合を生成する。
  • SLを生の共変量に直接適用するとともに、hdPSによって生成された変数を組み込んだ場合の両者を評価し、性能向上を測定する。
  • モデルの性能は、3つの指標(負の対数尤度、受検者操作特性曲線下積分(AUC)、時間計算量)を用いて評価する。
  • hdPSの段階におけるロジスティック回帰に正則化(LASSO)を適用し、特に小さなデータセットにおいて過学習を低減する。

実験結果

リサーチクエスチョン

  • RQ1電子的医療データベースにおける治療割り当ての予測において、Super Learnerは個々の予測モデルを上回る予測精度を示すか?
  • RQ2Super Learnerと高次元プロピティススコア (hdPS) メソッドを組み合わせることで、単独で使用する場合と比較して、予測性能が向上するか?
  • RQ3異なるデータ構造とサイズを持つさまざまな医療データベースにおいて、SLの予測性能はどのように変動するか?
  • RQ4正則化が、特に過学習の低減という観点から、hdPSに基づく予測モデルに与える影響は何か?
  • RQ5SLのデータに適応する性質が、複雑で高次元の請求データをモデル化する際、どのように堅牢性を向上させるか?

主な発見

  • Super Learnerアルゴリズムは、3つの医療データベースすべてにおいて、負の対数尤度とAUCという指標で、個々のモデルよりも一貫して優れた予測性能を示した。
  • Super Learnerと高次元プロピティススコア (hdPS) 変数の組み合わせが、特にAUCの最大化において、最も一貫性があり高い予測性能を達成した。
  • 勾配ブースティングとhdPSが、すべてのデータセットにおいてSLアンサンブルで最も高い重みを獲得しており、予測における主導的役割を果たしていることが示された。
  • hdPS段階での正則化(LASSO)によりわずかな性能向上が得られたが、これは小さなデータセットにおいて利点があることを示唆しているが、現在の大きな標本設定では効果は限定的であった。
  • SLは強力なデータに適応する特性を示し、データ構造に応じて最も効果的なアルゴリズムの重みを自動的に調整することで、堅牢性を向上させた。
  • 本研究は、SLが漸近的に最適であり、正しく指定されたパラメトリックモデルがなくても、ライブラリ内の最良のモデルと同等以上に性能を発揮することを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。