Skip to main content
QUICK REVIEW

[論文レビュー] Embedding Electronic Health Records for Clinical Information Retrieval

Xing Wei, Carsten Eickhoff|arXiv (Cornell University)|Nov 13, 2018
Machine Learning in Healthcare参考文献 12被引用数 10
ひとこと要約

本論文では、MIMIC-IIIデータセットを用いて、ICDコード予測を代理タスクとして用いることで、遠隔教師付き学習のアプローチを提案し、EHRノートから意味的・臨床的に意味のある表現を持つ高密度テキスト埋め込みを学習する。この埋め込み表現は、特に文脈的で長いクエリに対して、従来の情報検索モデルを上回り、深層類似度マッチングモデルと組み合わせることで最先端の性能を達成する。

ABSTRACT

Neural network representation learning frameworks have recently shown to be highly effective at a wide range of tasks ranging from radiography interpretation via data-driven diagnostics to clinical decision support. This often superior performance comes at the price of dramatically increased training data requirements that cannot be satisfied in every given institution or scenario. As a means of countering such data sparsity effects, distant supervision alleviates the need for scarce in-domain data by relying on a related, resource-rich, task for training. This study presents an end-to-end neural clinical decision support system that recommends relevant literature for individual patients (few available resources) via distant supervision on the well-known MIMIC-III collection (abundant resource). Our experiments show significant improvements in retrieval effectiveness over traditional statistical as well as purely locally supervised retrieval models.

研究の動機と目的

  • 情報検索のための有効な臨床テキスト埋め込みを学習する際のデータ不足の課題に対処すること。
  • 豊富なICDコードラベル付きデータを代理の教師信号として用いて、高品質で文脈を考慮したEHRノートからの埋め込みを生成する手法を開発すること。
  • 語彙レベルの表現を超えて意味的文脈を捉えることで、長い臨床クエリの検索効果を向上させること。
  • ICDコード予測という関連分類タスクで学習した埋め込みが、下流の情報検索タスクにうまく一般化されることを示すこと。

提案手法

  • MIMIC-IIIのEHRノートを用いて、事前学習済みの単語埋め込みを入力として、畳み込みニューラルネットワーク(CNN)をICD-10診断コード予測に訓練する。
  • CNNの学習済み隠れ層の表現を、全医療ノートまたは段落の高密度で文脈を反映した埋め込みとして抽出する。
  • 訓練済みの埋め込みモデルを用いて、クエリおよび候補文書を固定長のベクトルに符号化し、検索に用いる。
  • 段落埋め込みを深層類似度マッチングモデル(DRMM)に供給し、クエリと文書ペア間の関連スコアを計算する。
  • クエリと文書の埋め込み間のコサイン類似度を、代替または補完的なスコア関数として適用する。
  • 複数のスコア関数(DRMM、コサイン類似度、アンサンブル)を組み合わせることで、全体の検索性能を向上させる。

実験結果

リサーチクエスチョン

  • RQ1ICDコード予測のような代理タスクが、臨床情報検索に一般化可能な高密度テキスト埋め込みを効果的に学習できるか?
  • RQ2本手法の埋め込み手法は、患者症例のための関連バイオメディカル文献を検索する際、従来のIRモデル(例:BM25)と比較してどのように優れているか?
  • RQ3より長い、文脈を含むクエリでは、埋め込みベースの検索モデルの性能が向上するか?
  • RQ4MIMIC-IIIのような大規模かつリソース豊富なデータセットを用いた遠隔教師付き学習が、リソースが限られた臨床検索シナリオにおけるデータ不足を効果的に緩和できるか?

主な発見

  • 提案手法の埋め込みモデルは、TREC-CDS 2016データセットにおいて、従来のIRベースライン(例:BM25)を著しく上回り、アンサンブル手法でMAPが0.2084を達成した。
  • 文書埋め込み間のコサイン類似度のみで、TREC-CDSで最高のP@20(0.2267)とnDCG@20(0.1548)を記録し、優れた意味的マッチング能力を示した。
  • Tipsterデータセットでは、アンサンブルモデルが最高のMAP(0.3573)、P@20(0.4488)、nDCG@20(0.4746)を達成し、強力な一般化性能を示した。
  • 段落埋め込みを用いたDRMMモデル(DRMM+para)は、両方のデータセットでBM25を上回り、文脈を反映した埋め込みの価値を裏付けた。
  • モデルの性能は特に長い、複数段落にわたるクエリに対して顕著に高く、実世界の臨床意思決定支援シナリオに適していることが示唆された。
  • ICDコード予測タスクで、埋め込みモデルは20.72%の精度を達成し、臨床的に意味のある表現を学習できていることを裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。