Skip to main content
QUICK REVIEW

[論文レビュー] Application of Clinical Concept Embeddings for Heart Failure Prediction in UK EHR data

Spiros Denaxas, Pontus Stenetorp|arXiv (Cornell University)|Nov 23, 2018
Machine Learning in Healthcare参考文献 30被引用数 5
ひとこと要約

本研究では、英国の電子歴史(EHR)データにGloVeベースの臨床概念埋め込みを適用し、心不全リスクを予測する。診断および処置の低次元表現が、ワンホットエンコーディングに比べて予測性能を向上させることを示した。主な診断および処置を組み合わせた埋め込みを用いた手法では、AUROCが0.6965に達し、多様なデータソースにおいてわずかな向上と高い頑健性を示した。

ABSTRACT

Electronic health records (EHR) are increasingly being used for constructing disease risk prediction models. Feature engineering in EHR data however is challenging due to their highly dimensional and heterogeneous nature. Low-dimensional representations of EHR data can potentially mitigate these challenges. In this paper, we use global vectors (GloVe) to learn word embeddings for diagnoses and procedures recorded using 13 million ontology terms across 2.7 million hospitalisations in national UK EHR. We demonstrate the utility of these embeddings by evaluating their performance in identifying patients which are at higher risk of being hospitalised for congestive heart failure. Our findings indicate that embeddings can enable the creation of robust EHR-derived disease risk prediction models and address some the limitations associated with manual clinical feature engineering.

研究の動機と目的

  • 英国のEHRデータから低次元の臨床概念埋め込みを構築・評価し、心不全リスク予測を実現すること。
  • 高次元かつ多様なEHRデータにおいて、手動による特徴工学の依存度を低減できるかどうかを評価すること。
  • 大規模で複数の医療提供者にまたがる英国のEHRデータセットにおいて、埋め込み手法と従来のワンホットエンコーディングの予測性能を比較すること。
  • 主診断と副診断、処置などの異なる臨床データ要因がモデル性能に与える影響を調査すること。

提案手法

  • 英国バイオバンクEHRデータに含まれる270万件の入院履歴から抽出された1300万語のオントロピー語彙を用いて、GloVe単語埋め込みを学習した。
  • 4種類の異なるコーパスを構築した:主診断(PRIMDX)、主診断+処置(PRIMDX-PROC)、主診断+副診断(PRIMDX-SECDX)、およびすべての要因を統合した(PRIMDX-SECDX-PROC)。
  • 患者ごとの記録を、EHRに含まれるすべての臨床概念の埋め込みの平均を用いて、密なベクトル表現に変換した。
  • 5分割交差検証を用いて、患者レベルの埋め込みを入力として線形SVM分類器を学習し、ハイパーパramータはグリッドサーチで最適化した。
  • ホールドアウトテストセットを用いて、AUROCと加重F1スコアを評価し、ベクトルサイズやコンテキストウィンドウサイズの変化に伴う性能を分析した。
  • 学習済み埋め込み空間における臨床概念間の意味的関係を可視化するためにt-SNEを用いた。

実験結果

リサーチクエスチョン

  • RQ1GloVeベースの臨床概念埋め込みは、英国の人口を対象とした心不全リスク予測において、多様なEHRデータを効果的に表現できるか?
  • RQ2英国のEHRデータにおいて、埋め込みベースのモデルの予測性能は、従来のワンホットエンコーディングモデルに比べて優れているか?
  • RQ3主診断と副診断、処置などの異なる臨床データの組み合わせの中で、最も高い予測性能を達成するのはどれか?
  • RQ4埋め込みの使用により、単一ソースの研究と比較して、多様で複数の医療提供者にまたがるEHRソースにおいてモデルの頑健性が向上するか?

主な発見

  • 臨床概念埋め込みを用いた最良のモデルは、主診断と副診断に加えて処置を組み合わせた場合に、AUROCが0.6965、F1スコアが0.7500に達した。
  • 埋め込みはワンホットエンコーディングにわずかに優れており、PRIMDX-SECDX-PROCモデルが最高のAUROC(0.6965)とF1(0.7500)を記録した。
  • PRIMDX-SECDX-PROCで学習したモデルは、PRIMDXのみで学習したモデルよりも一貫して優れた性能を示したが、最良の個別設定ではPRIMDXがわずかに優れていた。
  • 埋め込み空間は意味的な関係を適切に捉えており、I50(心不全)は生物学的に関連する用語(I25:慢性虚血性心疾患、I21:急性心筋梗塞)に近接して配置されていた。
  • 包括的でないコーパスでは、小さなベクトルサイズ(50D)と大きなコンテキストウィンドウ(10–20)が最適な結果をもたらしたのに対し、完全なコーパスでは大きなベクトルサイズ(250D)と小さなウィンドウ(5)が最適であった。
  • 米国ベースの類似手法を用いた先行研究と比較して、性能は概ね同等であり、異なる医療制度やデータソースにおいても埋め込みが頑健であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。