Skip to main content
QUICK REVIEW

[論文レビュー] Early Prediction of Acute Kidney Injury in Critical Care Setting Using Clinical Notes

Yikuan Li, Liang Yao|arXiv (Cornell University)|Nov 7, 2018
Machine Learning in Healthcare参考文献 10被引用数 13
ひとこと要約

本研究では、MIMIC-IIIデータベースから得たICU入室後24時間以内の臨床ノートを用いて、自然言語処理(NLP)に基づく機械学習モデルを開発し、入室後72時間以内の急性腎障害(AKI)発症を予測した。MetaMapとUMLSを用いて臨床的に意味のある語句および概念特徴を抽出し、教師あり分類器を適用することで、AUC 0.779という競争力のある性能を達成した。これは、非構造化臨床ノートのNLPが、一般の集中治療患者における早期AKIリスク予測を可能にできることを示している。

ABSTRACT

Acute kidney injury (AKI) in critically ill patients is associated with significant morbidity and mortality. Development of novel methods to identify patients with AKI earlier will allow for testing of novel strategies to prevent or reduce the complications of AKI. We developed data-driven prediction models to estimate the risk of new AKI onset. We generated models from clinical notes within the first 24 hours following intensive care unit (ICU) admission extracted from Medical Information Mart for Intensive Care III (MIMIC-III). From the clinical notes, we generated clinically meaningful word and concept representations and embeddings, respectively. Five supervised learning classifiers and knowledge-guided deep learning architecture were used to construct prediction models. The best configuration yielded a competitive AUC of 0.779. Our work suggests that natural language processing of clinical notes can be applied to assist clinicians in identifying the risk of incident AKI onset in critically ill patients upon admission to the ICU.

研究の動機と目的

  • 非構造化臨床ノートを用いた、集中治療を必要としている患者における急性腎障害(AKI)の早期予測のためのデータ駆動型手法の開発。
  • 臨床ノートの自然言語処理が、従来のバイオマーカーを上回る早期AKIリスク予測を可能にするかを検証すること。
  • 臨床ノートを用いたAKI予測において、複数の機械学習分類器および知識ガイドド型ディープラーニングの性能を評価すること。
  • AKI発症と相関する臨床的に意味のある特徴をノートから同定すること。
  • NLPを用いて早期に高リスク患者を特定することで、集中治療における臨床意思決定支援の実現可能性を評価すること。

提案手法

  • 18歳以上の患者の、ICU入室後最初の24時間分の臨床ノートをMIMIC-IIIデータベースから抽出した。
  • テキスト前処理には、個人情報(PHI)のマスキング、ポーター法のステミング、頻度が100未満の語句(ドキュメント頻度 < 100)および313語のストップワードの削除を含めた。
  • 2種類の特徴表現を生成した:ユニグラムを用いたbag-of-words(単語の袋)と、MetaMapを用いたUMLS概念固有識別子(CUI)を用いたbag-of-concepts(概念の袋)。
  • 5種類の教師あり学習分類器(ロジスティック回帰、SVM、ランダムフォレスト、XGBoost、lightGBM)および知識ガイドド型CNNを、これらの特徴セット上で学習させた。
  • 最も優れた性能を示したモデルは、bag-of-wordsとbag-of-CUIsの特徴を統合したL2正則化付きロジスティック回帰であり、AUC 0.779を達成した。
  • モデルの性能評価には、7:3の訓練対テスト分割を用い、患者単位でのデータ分離によりデータ漏洩を防いだ。

実験結果

リサーチクエスチョン

  • RQ1ICU入室後24時間以内の臨床ノートの自然言語処理を用いて、72時間以内のAKI発症を臨床的に有用な精度で予測できるか?
  • RQ2臨床的予測に寄与するNLP由来の特徴(語句または医学的概念)として、どの特徴がAKI発症に対して最も予測的か?
  • RQ3臨床ノートを用いたAKI予測において、異なる機械学習分類器の性能はどのように比較されるか?
  • RQ4知識ガイドド型ディープラーニングアーキテクチャは、従来の分類器に比べ、この臨床的NLPタスクで予測精度を向上させられるか?
  • RQ5モデルが将来のAKI発症を示唆する主要な臨床用語および概念は何か?

主な発見

  • L2正則化付きロジスティック回帰を用い、bag-of-wordsとbag-of-CUIsの特徴を統合した最良のモデルは、AKI発症予測においてAUC 0.779を達成した。
  • 『cabg』『lasix』『swan』『insulin』といった臨床的に意味のある語句が、モデル内で高い重みを持つ特徴として特定され、強い予測的関連性を示した。
  • 『urosepsis』という語はノートにわずか79件しか出現しなかったが、AKIと強く関連しており、用語マッピングの改善の余地があることが示唆された。
  • 誤差分析の結果、高リスクの外科的後患者(例:CABG後)では、高係数語句の頻出により、AKIがなくても過剰に予測されるケースが見られた。
  • 知識ガイドド型CNNは、従来の分類器を上回る性能を示さなかった。これは、臨床ノートデータセットが長文が多く、規模が小さいことが要因と考えられる。
  • 特徴分析により、モデルが臨床的に関連する信号を捉えていることが確認された。具体的には、『central-core-myopathy』(CUI)および『rhabdomyolysis』といった、AKIの既知のリスク要因である概念が、予測に寄与していた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。