Skip to main content
QUICK REVIEW

[論文レビュー] Language Models Are An Effective Patient Representation Learning Technique For Electronic Health Record Data

Ethan Steinberg, Ken Jung|arXiv (Cornell University)|Jan 6, 2020
Machine Learning in Healthcare参考文献 48被引用数 10
ひとこと要約

本論文は、大規模な言語モデル学習目的からの転移学習を活用して固定長の患者埋め込み表現を生成する、電子歴史記録(EHR)データ向けの臨床言語モデルベースの表現(CLMBR)を提案する。訓練データが限られる状況において、CLMBRは平均でAUROCを19%向上させ、カウントベースのベースラインやエンドツーエンドのディープラーニングモデルを上回る性能を示し、特にデータが少ない状況で顕著な優位性を示す。

ABSTRACT

Widespread adoption of electronic health records (EHRs) has fueled the development of using machine learning to build prediction models for various clinical outcomes. This process is often constrained by having a relatively small number of patient records for training the model. We demonstrate that using patient representation schemes inspired from techniques in natural language processing can increase the accuracy of clinical prediction models by transferring information learned from the entire patient population to the task of training a specific model, where only a subset of the population is relevant. Such patient representation schemes enable a 3.5% mean improvement in AUROC on five prediction tasks compared to standard baselines, with the average improvement rising to 19% when only a small number of patient records are available for training the clinical prediction model.

研究の動機と目的

  • EHRからの臨床予測モデルを訓練する際のデータ不足の課題を、表現学習を活用して解決すること。
  • 標準ベースラインやエンドツーエンドのディープラーニングモデルと比較して、言語モデルベースの患者表現が予測性能を向上させることを調査すること。
  • 特にデータが少ない状況において、表現の質がモデル性能に与える影響を、さまざまな訓練データサイズの下で評価すること。
  • 臨床言語モデルによる転移学習が、手動による特徴工学や単純なカウントベースの表現を上回ることを検証すること。
  • CLMBRの一般化可能性とスケーラビリティを、複数の臨床アウトカムとデータ環境において評価すること。

提案手法

  • 著者らは、大規模なEHRコーパス上で臨床言語モデル(CLMBR)を訓練し、患者の外来訪問履歴における順序的パターンを学習する。EHRを自然言語のシーケンスとして扱う。
  • CLMBRは、文脈から欠落している医療コード(例:ICD-10、CPT、LOINC)を予測するためのマスクド言語モデルの目的関数を用い、EHRデータ内の時間的・階層的構造を捉える。
  • 各患者の完全なEHR履歴を微調整済みのCLMBRモデルで符号化することで、固定長の埋め込み表現を生成する。
  • 得られた学習済み表現を、ロジスティック回帰や勾配ブースティングツリーなどの下流の臨床予測モデルの入力特徴として用いる。
  • 本手法は、5つの臨床予測タスクにおいて、カウントベースの表現(例:頻度ベクトル)とエンドツーエンドのディープニューラルネットワークと比較される。
  • データの効率性とスケーラビリティを評価するために、さまざまな訓練データサイズにおけるAUROCを用いて性能を評価する。

実験結果

リサーチクエスチョン

  • RQ1言語モデルベースの表現は、EHRデータにおける標準ベースラインと比較して、臨床予測モデルの性能を向上させることができるか?
  • RQ2特にデータが少ない状況において、CLMBRの表現性能は訓練データサイズにどのように依存するか?
  • RQ3言語モデル学習の目的関数の選択が、下流の予測タスクにおける患者表現の質に顕著な影響を与えるか?
  • RQ4予測精度とデータ効率の観点から、CLMBRの表現はエンドツーエンドのディープラーニングモデルと比較してどうなるか?
  • RQ5勾配ブースティングツリーのような強力な下流モデルと組み合わせた場合、言語モデルベースの表現は単純なカウントベースの特徴を上回るか?

主な発見

  • CLMBR表現は、5つの臨床予測タスクにおいて、標準ベースラインと比較して平均でAUROCを3.5%向上させた。
  • 訓練に使用可能な患者レコードが少ない場合、CLMBR表現による性能向上は平均でAUROC19%に達した。
  • 大規模データ環境下でも、CLMBRベースのモデルはエンドツーエンドのディープニューラルネットワークを上回った。これは、従来の予想をはるかに超える汎用性を示している。
  • カウントベースの表現を用いた場合、L2正則化付きロジスティック回帰よりも勾配ブースティングツリーの性能が顕著に優れていた。これは、モデル選択が報告された性能差の主要因であることを示している。
  • 十分なデータがある場合、カウントベースの表現と強力なモデルを組み合わせることで、CLMBRの性能に匹敵する近い結果が得られ、AUROCでわずか3.5%の差にとどまった。
  • より大規模なCLMBRモデルは、以前に発表された臨床言語モデルよりも優れた表現を生成した。これは、モデルアーキテクチャと目的関数設計の重要性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。