Skip to main content
QUICK REVIEW

[论文解读] Evaluating the Portability of an NLP System for Processing Echocardiograms: A Retrospective, Multi-site Observational Study

Prakash Adekkanattu, Guoqian Jiang|arXiv (Cornell University)|Apr 1, 2019
Biomedical Text Mining and Ontologies参考文献 23被引用 15
一句话总结

本研究评估了最初在退伍军人事务部(VA)开发的自然语言处理(NLP)系统在三个学术医疗中心之间跨机构迁移的可移植性,该系统用于从超声心动图报告中提取27种心脏相关概念。尽管该系统在四个关键概念(主动脉瓣/二尖瓣/三尖瓣反流、左心房大小)上实现了高精度和高召回率,但其余概念在不同机构间的性能差异显著,凸显了跨机构NLP泛化面临的挑战。

ABSTRACT

While natural language processing (NLP) of unstructured clinical narratives holds the potential for patient care and clinical research, portability of NLP approaches across multiple sites remains a major challenge. This study investigated the portability of an NLP system developed initially at the Department of Veterans Affairs (VA) to extract 27 key cardiac concepts from free-text or semi-structured echocardiograms from three academic medical centers: Weill Cornell Medicine, Mayo Clinic and Northwestern Medicine. While the NLP system showed high precision and recall measurements for four target concepts (aortic valve regurgitation, left atrium size at end systole, mitral valve regurgitation, tricuspid valve regurgitation) across all sites, we found moderate or poor results for the remaining concepts and the NLP system performance varied between individual sites.

研究动机与目标

  • 评估在VA超声心动图报告上训练的NLP系统在多个外部学术医疗中心的可移植性。
  • 评估该系统在不同机构的自由文本和半结构化超声心动图报告中提取27个关键心脏概念时是否能保持高性能。
  • 识别导致各机构间性能差异的因素,特别是针对表现不佳的关键概念。
  • 为多中心医疗环境中临床文本挖掘的稳健、可泛化NLP系统开发提供依据。

提出的方法

  • 将NLP系统应用于三家外部机构的超声心动图报告:Weill Cornell Medicine、Mayo Clinic和Northwestern Medicine。
  • 系统采用基于规则和机器学习的技术,从非结构化和半结构化的临床叙述中提取27个预定义的心脏概念。
  • 通过精确率、召回率和F1分数指标评估性能,将系统输出与各机构的专家标注金标准进行比较。
  • 采用回顾性、多中心观察性研究设计,数据来自现有的电子健康记录系统。
  • 在所有机构中均未进行微调或再训练,直接部署相同NLP模型,以测试其即插即用的泛化能力。
  • 分析机构间的性能差异,以识别术语使用、报告结构或文档实践方面的机构特异性差异。

实验结果

研究问题

  • RQ1在VA超声心动图报告上训练的NLP系统,能否在其他学术医疗中心的报告中保持高性能?
  • RQ2该系统在不同机构中对同一组27个心脏概念的性能表现如何变化?
  • RQ3哪些特定心脏概念在各机构间表现出最显著的性能下降?原因是什么?
  • RQ4临床文档风格或术语的差异在多大程度上影响了NLP系统的可移植性?

主要发现

  • 在所有三个机构中,该NLP系统对四个关键概念(主动脉瓣反流、收缩末期左心房大小、二尖瓣反流、三尖瓣反流)均实现了高精确率和高召回率(F1 > 0.8)。
  • 其余23个心脏概念的性能中等或较差,至少在一个机构中F1分数低于0.6。
  • 即使针对同一概念,不同机构间的性能也存在显著差异,表明NLP泛化存在机构特异性挑战。
  • 研究发现,机构间术语使用和报告结构的不一致是导致性能差异的关键因素。
  • 该系统在少数定义明确、临床显著的概念上表现出强大的可移植性,但在更广泛的概念覆盖上表现不佳。
  • 未经微调或领域自适应的情况下,性能未见显著提升,凸显了在异构临床环境中部署NLP系统所面临的挑战。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。