Skip to main content
QUICK REVIEW

[論文レビュー] Prior Adaptive Semi-supervised Learning with Application to EHR Phenotyping

Yichi Zhang, Molei Liu|PubMed|Mar 26, 2020
Machine Learning in Healthcare参考文献 40被引用数 5
ひとこと要約

本稿では、ラベル付きデータが少量、ラベルなしデータ(特徴量Xのみ)が多数、かつ真の表現型Yを予測するのに有用な補助変数Sを用いる高次元スパース回帰手法であるPrior Adaptive Semi-supervised Learning (PASS)を提案する。PASSは、Sから導出される事前分布方向に推定子を適応的に圧縮することで、推定の効率性と頑健性を向上させ、三次病院システムにおけるシミュレーションおよび実世界のEHR表現型抽出の両方で、既存手法を上回る性能を発揮する。

ABSTRACT

Electronic Health Record (EHR) data, a rich source for biomedical research, have been successfully used to gain novel insight into a wide range of diseases. Despite its potential, EHR is currently underutilized for discovery research due to its major limitation in the lack of precise phenotype information. To overcome such difficulties, recent efforts have been devoted to developing supervised algorithms to accurately predict phenotypes based on relatively small training datasets with gold standard labels extracted via chart review. However, supervised methods typically require a sizable training set to yield generalizable algorithms, especially when the number of candidate features, <mml:math xmlns:mml="http://www.w3.org/1998/Math/MathML"><mml:mi>p</mml:mi></mml:math>, is large. In this paper, we propose a semi-supervised (SS) EHR phenotyping method that borrows information from both a small, labeled dataset (where both the label <mml:math xmlns:mml="http://www.w3.org/1998/Math/MathML"><mml:mi>Y</mml:mi></mml:math> and the feature set <mml:math xmlns:mml="http://www.w3.org/1998/Math/MathML"><mml:mi>X</mml:mi></mml:math> are observed) and a much larger, weakly-labeled dataset in which the feature set <mml:math xmlns:mml="http://www.w3.org/1998/Math/MathML"><mml:mi>X</mml:mi></mml:math> is accompanied only by a surrogate label <mml:math xmlns:mml="http://www.w3.org/1998/Math/MathML"><mml:mi>S</mml:mi></mml:math> that is available to all patients. Under a <i>working</i> prior assumption that <mml:math xmlns:mml="http://www.w3.org/1998/Math/MathML"><mml:mi>S</mml:mi></mml:math> is related to <mml:math xmlns:mml="http://www.w3.org/1998/Math/MathML"><mml:mi>X</mml:mi></mml:math> only through <mml:math xmlns:mml="http://www.w3.org/1998/Math/MathML"><mml:mi>Y</mml:mi></mml:math> and allowing it to hold <i>approximately</i>, we propose a prior adaptive semi-supervised (PASS) estimator that incorporates the prior knowledge by shrinking the estimator towards a direction derived under the prior. We derive asymptotic theory for the proposed estimator and justify its efficiency and robustness to prior information of poor quality. We also demonstrate its superiority over existing estimators under various scenarios via simulation studies and on three real-world EHR phenotyping studies at a large tertiary hospital.

研究の動機と目的

  • EHR表現型抽出におけるラベル付きデータの不足に起因する課題に対処すること。特に、レセプトリーのレビューによるゴールドスタンダードラベルは高価かつ希少である。
  • 特徴量数pが標本サイズに対して大きい高次元設定において、推定の効率性と頑健性を向上させること。
  • 真の表現型Yを予測できるが完全には一致しない補助変数Sからの事前知識を効果的に統合する半教師あり学習フレームワークを構築すること。
  • 事前情報(例:Sからの情報)が質が悪い場合や条件付き独立性仮定が破綻しても、手法が頑健に保たれることを保証すること。
  • XとSを用いて、病気状態Yの予測を正確に行いながら、高次元特徴空間における統計的効率性とスパarsityを維持すること。

提案手法

  • PASSは、単一インデックスモデルフレームワーク下で、ラベル付きデータ(Y, X)とラベルなしデータ(X, S)を統合した正則化推定問題を定式化する。
  • 推定子βを、S ~ Xから推定された事前方向α*にρに従って圧縮するペナルティ項を導入し、ρは事前情報とデータ駆動型推定のバランスを取るために適応的に選択される。
  • 2段階推定を採用する:まず、SをXに対してALASSO回帰することで補助方向α*を推定する。次に、βを、β − ρα*のスパarsityを促進する正則化尤度関数により推定する。
  • 理論的裏付けは、制限固有値仮定とβ₀ − ρα₀のスパarsityに依拠しており、これによりラベルなしデータが推定に有意義に寄与することが可能になる。
  • 条件付き独立性仮定S ⊥ X | Yが破綻しても、劣悪な事前情報を低減する適応的圧縮機構のおかげで、手法は頑健である。
  • 複数の補助変数S_kとそれに対応するα*_kを統合したペナルティ構造に拡張可能である。

実験結果

リサーチクエスチョン

  • RQ1ラベル付きデータが少量である状況において、大規模なラベルなしEHRデータを効果的に活用できる半教師あり学習手法は存在するか?
  • RQ2補助変数Sからの事前知識を、事前情報が不正確な場合に性能を劣化させずに高次元回帰に適応的に統合する方法は何か?
  • RQ3条件付き独立性仮定S ⊥ X | Yが破綻しても、提案されたPASS推定子は推定の効率性と頑健性を維持できるか?
  • RQ4既存の教師ありおよび半教師ありベースラインと比較して、実世界のEHRシステムにおける表現型抽出の正確性を向上させられるか?
  • RQ5高次元的、スパース的、および共線形な設定下で、推定子の一貫性および漸近的効率性の理論的裏付けは何か?

主な発見

  • シミュレーション研究において、PASSは特に高次元特徴量とノイズが多い、もしくは弱い補助変数を用いた状況で、既存手法を顕著に上回る性能を示した。
  • 大規模な三次病院システムにおける実世界のEHR表現型抽出応用において、PASSはより高い受検者操作特性曲線下積分(AUC)を達成し、予測精度の向上を示した。
  • 補助変数SがYを僅かにしか予測できない状況でも、PASSは劣悪な事前情報に対して耐性を示し、頑健性を維持した。
  • 理論的分析により、β₀ − ρα₀がスパースであるという仮定の下で、推定子の一貫性と漸近的効率性が確認された。これにより、ラベルなしデータの有効な利用が可能になった。
  • 真の信号が弱いか、設計行列が非楕円的分布を示す状況において、pLASSOやSS^priorと比較して、PASSはより優れた変数選択性能を示した。
  • 実験的結果から、PASSはSのみに依存する従来の非教師あり手法の限界である、P(Y=1 | S, X)のスケールの回復を効果的に実現できた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。