Skip to main content
QUICK REVIEW

[論文レビュー] Evaluating the Portability of an NLP System for Processing Echocardiograms: A Retrospective, Multi-site Observational Study

Prakash Adekkanattu, Guoqian Jiang|arXiv (Cornell University)|Apr 1, 2019
Biomedical Text Mining and Ontologies参考文献 23被引用数 15
ひとこと要約

本研究では、VAで開発された自然言語処理(NLP)システムの、3つの大学医学センターにおける心エコー検査報告書から27の心疾患概念を抽出する能力の移植性を評価している。システムは4つの主要な概念(大動脈・ mitral・三尖弁逆流、左房サイズ)に関して高い正確性と再現率を達成したが、残りの概念に関しては施設間で性能に顕著な差が見られ、多施設にわたるNLP一般化の課題が浮き彫りになった。

ABSTRACT

While natural language processing (NLP) of unstructured clinical narratives holds the potential for patient care and clinical research, portability of NLP approaches across multiple sites remains a major challenge. This study investigated the portability of an NLP system developed initially at the Department of Veterans Affairs (VA) to extract 27 key cardiac concepts from free-text or semi-structured echocardiograms from three academic medical centers: Weill Cornell Medicine, Mayo Clinic and Northwestern Medicine. While the NLP system showed high precision and recall measurements for four target concepts (aortic valve regurgitation, left atrium size at end systole, mitral valve regurgitation, tricuspid valve regurgitation) across all sites, we found moderate or poor results for the remaining concepts and the NLP system performance varied between individual sites.

研究の動機と目的

  • VAの心エコー検査報告書で訓練されたNLPシステムが、複数の外部の大学医学センターにわたっても移植可能かどうかを評価すること。
  • 異なる機関の自由記述および準構造化された心エコー検査報告書から27の主要な心疾患概念を抽出する際、システムが高い性能を維持できるかどうかを評価すること。
  • 特に上位で性能を発揮しない概念に関しては、性能のばらつきを引き起こす要因を同定すること。
  • 多施設の医療環境における臨床テキストマイニング用に、強固で一般化可能なNLPシステムの開発を支援すること。

提案手法

  • NLPシステムは、Weill Cornell Medicine、Mayo Clinic、Northwestern Medicineの3つの外部機関の心エコー検査報告書に適用された。
  • システムは、非構造化および準構造化された臨床ナラティブから27の事前に定義された心疾患概念を抽出するために、ルールベースおよび機械学習技術を用いた。
  • 性能評価には、各施設での専門家がアノテートしたゴールドスタンダードと比較して、正確性、再現率、F1スコアを用いた。
  • 既存の電子的健康記録システムからデータを収集した、後向きで多施設の観察的研究デザインが採用された。
  • 同じNLPモデルをすべての施設に再トレーニングやファインチューニングなしにデプロイしたため、システムの即時の一般化能力がテストされた。
  • 施設間での性能差を分析し、用語の使い方、レポート構造、または文書作成の習慣の差異が、性能のばらつきに与える影響を特定した。

実験結果

リサーチクエスチョン

  • RQ1VAの心エコー検査報告書で訓練されたNLPシステムが、他の大学医学センターの報告書に対しても高い性能を維持できるか?
  • RQ2同じ27の心疾患概念について、異なる機関でのシステムの性能はどのように変動するか?
  • RQ3どの特定の心疾患概念が、施設間で最も顕著に性能が低下しやすく、その理由は何か?
  • RQ4臨床文書作成スタイルや用語の違いが、NLPシステムの移植性にどの程度影響を及えるか?

主な発見

  • 大動脈弁逆流、収縮末期における左房サイズ、 mitral弁逆流、三尖弁逆流という4つの主要な概念について、3か所すべての施設で高い正確性と再現率(F1 > 0.8)を達成した。
  • 残りの23の心疾患概念に関しては、1つ以上の施設でF1スコアが0.6未満となり、中程度または低水準の性能となった。
  • 同じ概念に対しても、個々の施設間で性能に顕著な差が見られ、NLP一般化に施設固有の課題があることが示された。
  • 用語の不一致やレポート構造の差異が、性能のばらつきの主な要因であると同定された。
  • 明確に定義され、臨床的に顕著な少数の概念については、システムの移植性が強く示されたが、広範な概念カバレッジには苦慮した。
  • 再トレーニングやドメイン適応なしでは、性能に顕著な向上が見られず、多様な臨床環境へのNLPシステムの展開における課題が強調された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。