Skip to main content
QUICK REVIEW

[論文レビュー] A Deep Learning Pipeline for Patient Diagnosis Prediction Using Electronic Health Records

Leopold Franz, Yash Raj Shrestha|arXiv (Cornell University)|Jun 23, 2020
Machine Learning in Healthcare参考文献 30被引用数 19
ひとこと要約

本論文は、電子的健康記録(EHR)を用いた複数診断予測のためのディープラーニングパイプラインを提示し、臨床ノートと構造化データをそれぞれ活用する2つのモデル—ClinicalBERT_MultiとDeepObserver—を導入する。ClinicalBERT_Multiは入院後3日以内の早期診断において最高の予測性能を示し、解釈可能な注意可視化を提供する。一方、FHIRベースのデータ変換ツールにより、多様なデータセット間での標準化されたEHR統合が可能となる。

ABSTRACT

Augmentation of disease diagnosis and decision-making in healthcare with machine learning algorithms is gaining much impetus in recent years. In particular, in the current epidemiological situation caused by COVID-19 pandemic, swift and accurate prediction of disease diagnosis with machine learning algorithms could facilitate identification and care of vulnerable clusters of population, such as those having multi-morbidity conditions. In order to build a useful disease diagnosis prediction system, advancement in both data representation and development of machine learning architectures are imperative. First, with respect to data collection and representation, we face severe problems due to multitude of formats and lack of coherency prevalent in Electronic Health Records (EHRs). This causes hindrance in extraction of valuable information contained in EHRs. Currently, no universal global data standard has been established. As a useful solution, we develop and publish a Python package to transform public health dataset into an easy to access universal format. This data transformation to an international health data format facilitates researchers to easily combine EHR datasets with clinical datasets of diverse formats. Second, machine learning algorithms that predict multiple disease diagnosis categories simultaneously remain underdeveloped. We propose two novel model architectures in this regard. First, DeepObserver, which uses structured numerical data to predict the diagnosis categories and second, ClinicalBERT_Multi, that incorporates rich information available in clinical notes via natural language processing methods and also provides interpretable visualizations to medical practitioners. We show that both models can predict multiple diagnoses simultaneously with high accuracy.

研究の動機と目的

  • 医療分野における機械学習の応用を阻害する、断片的で相互運用性のない電子的健康記録(EHR)データ形式の課題に対処すること。
  • MIMIC-III EHRデータセットをFHIR形式に変換することで、広範な研究適合性を実現する普遍的なデータ表現フレームワークの構築。
  • 複数の診断コードを同時に高精度に予測できる新しいディープラーニングアーキテクチャの設計と評価。
  • ClinicalBERT_Multiモデルにおける注意可視化を通じた、臨床医の意思決定支援のためのモデル解釈性の向上。
  • 臨床ノートと構造化された数値データの両方を活用し、ICU入室後3日以内に早期診断予測を実現すること。

提案手法

  • 著者らは、MIMIC-III EHRデータセットをフラットなFHIR(Fast Healthcare Interoperability Resources)形式にマッピングするPythonパッケージを開発し、標準化された相互運用性のあるデータアクセスを可能にした。
  • DeepObserverモデルは、Charteventsテーブルからのバイナリ化された時系列数値データを処理する1次元畳み込みニューラルネットワーク(CNN)を用い、マルチラベル分類により複数の診断コードを予測する。
  • ClinicalBERT_Multiモデルは、臨床ノート上でClinicalBERTをファインチューニングし、ClinicalBERT論文の式3に基づく確率的組み合わせ戦略を用いて複数のテキストチャンクからの埋め込みを統合する。
  • 予測の解釈性を高めるために、注意重みを可視化し、臨床的に関連するトークン(例:「failure」が含まれる「acute respiratory failure」)に高い注意スコアが集中していることを確認した。
  • 診断予測は入院後3日、6日、12日という3つの時間点で実施され、早期予測の性能が評価された。
  • モデルはMIMIC-IIIデータセット上で訓練および評価され、複数のCCS診断カテゴリにおけるAU-PRおよびAUC指標を用いて性能が測定された。

実験結果

リサーチクエスチョン

  • RQ1標準化されたFHIRベースのデータ変換パイプラインは、機械学習研究における多様なEHRデータセットの相互運用性と利用可能性を向上させることができるか?
  • RQ2構造化されたEHRデータと臨床ノートの両方を処理するディープラーニングモデルは、複数診断予測において高い正確性を達成できるか?
  • RQ3ICU入室後3日以内に、EHRデータに基づくディープラーニングを用いて早期診断予測を信頼性高く実現できるか?
  • RQ4ClinicalBERT_Multiにおける注意可視化は、臨床意思決定支援のための解釈性をどの程度向上させることができるか?
  • RQ5CNNベースのモデル(DeepObserver)とトランスフォーマーに基づくモデル(ClinicalBERT_Multi)の間で、マルチラベル診断予測における性能特性にどのような差異が生じるか?

主な発見

  • ClinicalBERT_Multiは、最高の予測性能を示し、特に入院後3日以内の早期診断予測において最高のAU-PRスコアを記録した。
  • モデルは、臨床ノートからの豊富なテキスト情報を活用して、複数の診断コードを同時に予測する能力に優れていた。
  • 注意可視化により、モデルが「acute respiratory failure」における「failure」といった臨床的に関連する用語に正しく注目していることが明らかになった。
  • DeepObserverは、臨床ノートに依存せず、Charteventsテーブルからの構造化された数値データのみを用いても高いAU-PRスコアを達成した。
  • FHIR変換パッケージは、MIMIC-IIIデータセットを標準化されたアクセス可能な形式に成功して変換し、他の臨床データセットとの統合を容易にした。
  • 両モデルとも、観察を8時間ごとのインターバルにバイナリ化したことによる高分解能の時間的パターンの捉え損ないの制限を示しており、今後の研究では高分解能モデリングの必要性が示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。