Skip to main content
QUICK REVIEW

[論文レビュー] A Predictive Approach Using Deep Feature Learning for Electronic Medical Records: A Comparative Study.

Milad Zafar Nezhad, Dongxiao Zhu|arXiv (Cornell University)|Jan 6, 2018
Machine Learning in Healthcare参考文献 37被引用数 7
ひとこと要約

本論文は、限られたラベル付きデータから強力で高レベルの特徴を抽出するために自己教師あり表現学習を活用する、深層特徴学習および単語埋め込みに基づく予測モデリング手法を提案する。この手法は、大規模なeICUデータセットにおいて、アフリカ系アメリカ人のLVMI予測およびICU滞在期間予測において、ベースラインモデルよりも優れた性能を達成した。

ABSTRACT

Massive amount of electronic medical records accumulating from patients and populations motivates clinicians and data scientists to collaborate for the advanced analytics to extract knowledge that is essential to address the extensive personalized insights needed for patients, clinicians, providers, scientists, and health policy makers. In this paper, we propose a new predictive approach based on feature representation using deep feature learning and word embedding techniques. Our method uses different deep architectures for feature representation in higher-level abstraction to obtain effective and more robust features from EMRs, and then build prediction models on the top of them. Our approach is particularly useful when the unlabeled data is abundant whereas labeled one is scarce. We investigate the performance of representation learning through a supervised approach. First, we apply our method on a small dataset related to a specific precision medicine problem, which focuses on prediction of left ventricular mass indexed to body surface area (LVMI) as an indicator of heart damage risk in a vulnerable demographic subgroup (African-Americans). Then we use two large datasets from eICU collaborative research database to predict the length of stay in Cardiac-ICU and Neuro-ICU based on high dimensional features. Finally we provide a comparative study and show that our predictive approach leads to better results in comparison with others.

研究の動機と目的

  • 豊富なラベルなしデータを活用して特徴表現を学習することで、電子的医療記録(EMR)におけるラベル付きデータが限られる課題に対処する。
  • 深層表現学習を用いて、限られたラベル付きデータでも高い性能を発揮する、耐性があり包括的な予測モデリングフレームワークを開発する。
  • 深層アーキテクチャと単語埋め込みが、EMRから高レベルの抽象的特徴を抽出する有効性を調査する。
  • 精密医療とICU滞在期間予測を含む多様な臨床予測タスクにおいて、本手法の汎用性を評価する。
  • 限られたラベル付きデータ環境下での既存手法との比較分析を通じて、提案手法の優位性を示す。

提案手法

  • 生のEMRテキストおよび構造化データから階層的で高レベルの表現を学習するため、深層ニューラルネットワークアーキテクチャを採用する。
  • 臨床的テキストを意味を捉えた密なベクトル表現に変換するため、単語埋め込み技術を活用する。
  • 大規模なラベルなしEMRデータを用いて自己教師ありまたは対照的事前学習を実施し、効果的な特徴表現を学習する。
  • 限られたラベル付きデータを用いて、学習済み表現を下流の予測タスクに微調整する。
  • LVMI予測やICU滞在期間予測などのタスクに対して、深層特徴表現の上に教師あり予測モデルを訓練する。
  • 複数のデータセットおよびタスクにおいて、提案手法と従来の手法および深層学習ベースラインとの性能を比較する。

実験結果

リサーチクエスチョン

  • RQ1ラベル付きデータが限られる状況下で、単語埋め込みを用いた深層特徴学習は、EMRベースの臨床モデリングにおける予測性能を向上させることができるか?
  • RQ2大規模なラベルなしEMRデータからの表現学習は、下流の予測タスクの性能向上にどの程度有効であるか?
  • RQ3提案手法は、アフリカ系アメリカン患者における心筋障害リスクのマーカーであるLVMIを予測する際に、既存手法を上回る性能を示すか?
  • RQ4本手法は、心疾患ICUおよび神経科ICUにおけるICU滞在期間予測に、大規模なICUデータに対してどの程度汎用性を示すか?
  • RQ5多様な臨床予測タスクにおいて、提案手法とベースラインモデルの相対的性能はどのようになるか?

主な発見

  • 提案された深層特徴学習アプローチは、脆弱なデモグラフィックサブグループにおける左室質量指数(LVMI)予測において、ベースラインモデルを上回る予測性能を達成した。
  • 限られたラベル付きデータの下でも、大規模なeICUデータセットにおいて、本手法は耐性と汎用性に優れた性能を示した。
  • 豊富なラベルなしEMRデータからの表現学習は、特徴品質を顕著に向上させ、より正確な予測を可能にした。
  • 深層アーキテクチャと単語埋め込みの統合により、従来の特徴工学的アプローチよりも、テキストおよび構造化EMRデータ内の臨床的関連パターンをより効果的に捉えることができた。
  • 比較研究により、本手法は小規模な精密医療タスクおよび大規模なICU予測タスクの両方において、一貫して既存手法を上回ることが確認された。
  • 結果から、ラベルなしEMRデータに対する自己教師あり事前学習は、ラベル付きデータが限られる状況下での下流の臨床予測性能向上に有効な戦略であると示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。