Skip to main content
QUICK REVIEW

[論文レビュー] Extractive Summarization of EHR Discharge Notes

Emily Alsentzer, Anne Kim|arXiv (Cornell University)|Oct 26, 2018
Topic Modeling参考文献 17被引用数 20
ひとこと要約

本論文は、電子歴史記録(EHR)退院ノートの要約抽出のためのLSTMベースのシーケンスラベル付けモデルを提案する。特に、現在の病歴(HPI)セクションを対象としており、テストセットでF1スコア0.886を達成し、自動化された退院ノート作成を進めるためにトピック固有の評価データセットを構築する上で優れた性能を示している。

ABSTRACT

Patient summarization is essential for clinicians to provide coordinated care and practice effective communication. Automated summarization has the potential to save time, standardize notes, aid clinical decision making, and reduce medical errors. Here we provide an upper bound on extractive summarization of discharge notes and develop an LSTM model to sequentially label topics of history of present illness notes. We achieve an F1 score of 0.876, which indicates that this model can be employed to create a dataset for evaluation of extractive summarization methods.

研究の動機と目的

  • 退院ノートにおける情報抽出可能性の上限を測定することで、EHRの他の部分に記載された退院ノートの情報の割合を特定し、抽出要約の上限を設定すること。
  • 10の意味的カテゴリー(例:症状・徴候、診断歴、患者の移動)に分類する、語のラベル付けを同時に実行するニューラルネットワークモデルの開発。
  • MIMIC-IIIデータベースに含まれる55,177件の脱 identifiers された退院ノートから、高品質でトピックアノテート済みのデータセットを構築し、将来的な抽出要約手法の評価に用いること。
  • 学習済み単語埋め込みと組み合わせた概念固有識別子(CUI)の統合、およびさまざまな埋め込みアーキテクチャの検討により、モデル性能の向上を図ること。
  • アノテーター間の一貫性を評価し、ラベル付けの不一致を特定することで、臨床NLP分野における将来的なアノテーション基準の整備に寄与すること。

提案手法

  • 研究者は、ICU患者の55,177件の匿名化された退院ノートと関連する臨床ノートを含むMIMIC-IIIデータベースを用いた。
  • 正規表現を適用して退院ノートを構造化されたセクションに分割し、特にラベル付けの対象として現在の病歴(HPI)セクションに焦点を当てた。
  • 語レベルのトークン埋め込みを用いた双方向LSTMモデルを訓練し、1語あたり10の意味的ラベル(例:症状・徴候、診断歴、患者の移動、薬物)のうち1つを予測するようにした。
  • 学習済みおよび事前学習済み単語埋め込み(例:word2vec)を用い、文字レベルの埋め込みの有無に関わらず、CUI(Concept Unique Identifier)統合の有無を変えてモデルを訓練した。
  • 耐性を高めるために、文字埋め込みの有無や異なる埋め込みタイプを考慮した複数のアーキテクチャを評価した。
  • 複数のラベルが付与されるフレーズの処理のための後処理を実施し、保持されたテストセットを用いて精度、再現率、F1スコアでモデルの性能を評価した。

実験結果

リサーチクエスチョン

  • RQ1退院ノートに記載された情報のうち、どの程度がEHRの他の部分から抽出可能であり、抽出要約の上限を設定できるか?
  • RQ2LSTMと単語埋め込みを用いたシーケンスラベル付けモデルは、HPIノートの臨床テキストを意味的で明確な意味的カテゴリーに効果的に分類できるか?
  • RQ3医療概念埋め込み(CUI)および文字レベル表現の統合は、臨床テキスト分類におけるモデル性能にどのように影響するか?
  • RQ4臨床テキストアノテーションにおける主なラベル付けの不一致の原因は何か。また、それらはモデル性能にどのように影響するか?
  • RQ5このモデルを用いて、抽出要約手法の評価に用いる大規模かつトピックアノテート済みのデータセットをどの程度まで生成できるか?

主な発見

  • 学習済み単語埋め込みを用いたモデルはF1スコア0.886を達成し、特に『Meds/Treatments』(F1=0.90)および『PatientMovement』(F1=0.93)で最高の性能を示した。
  • 『Vitals/Labs』カテゴリはF1が最低(0.40)であり、主に再現率が低かった(0.26)ため、これらの項目の特定が困難であることが示された。
  • 『MedicationHistory』カテゴリの再現率が低かった(0.56)ことから、薬物関連の内容がトレーニングデータに不足しているか、ラベル付けが一貫性に欠けている可能性が示唆された。
  • 学習済み単語埋め込みを用いたモデルが、事前学習済み埋め込みや文字レベル特徴を含む他のすべてのアーキテクチャを上回り、最高のF1スコアを達成した。
  • 混同行列の結果、『DiagnosisHistory』と『Symptoms/Signs』の間で頻繁に誤分類が発生しており、臨床的記述の重複が原因と考えられた。
  • 研究では、特に複数の節を含む複雑な文において、複数のアノテーター間での手動ラベル付けの不一致が主な誤り要因であることが判明し、標準化されたアノテーションプロトコルの必要性が強調された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。