[论文解读] Towards Clinical Encounter Summarization: Learning to Compose Discharge Summaries from Prior Notes
本文提出了一项新颖的任务:利用提取-摘要的流水线,从先前的非结构化电子健康记录(EHR)笔记中生成临床出院摘要。该研究提出了一种基于医学命名实体识别(NER)的忠实度感知评估框架,并证明,可追溯的抽取式-摘要式架构在七个医学部分中均表现出更优的忠实度和稳健性能,其中基于BART的模型在经过忠实度调整的F3分数上优于其他模型。
The records of a clinical encounter can be extensive and complex, thus placing a premium on tools that can extract and summarize relevant information. This paper introduces the task of generating discharge summaries for a clinical encounter. Summaries in this setting need to be faithful, traceable, and scale to multiple long documents, motivating the use of extract-then-abstract summarization cascades. We introduce two new measures, faithfulness and hallucination rate for evaluation in this task, which complement existing measures for fluency and informativeness. Results across seven medical sections and five models show that a summarization architecture that supports traceability yields promising results, and that a sentence-rewriting approach performs consistently on the measure used for faithfulness (faithfulness-adjusted $F_3$) over a diverse range of generated sections.
研究动机与目标
- 解决从多份文档会诊的大量非结构化EHR笔记中生成摘要的临床挑战。
- 提出一项新任务:使用可追溯的、基于证据的方法,从先前的临床笔记中生成出院摘要。
- 评估摘要模型在忠实度、可追溯性和长临床文本可扩展性方面的表现。
- 引入并验证一种新颖的基于NER的忠实度度量方法,用于检测摘要中的幻觉现象。
- 创建一个基于MIMIC-III的数据集,用于临床多文档摘要研究。
提出的方法
- 提出一种抽取式-摘要式摘要流水线:首先从先前的临床笔记中提取相关句子,然后将这些句子抽象化提炼为连贯的出院摘要部分。
- 使用以召回为导向的提取器(如RNN+强化学习或逻辑回归)从长序列的临床文档中识别关键句子。
- 采用预训练的序列到序列模型(BART)作为摘要器,从提取的内容中生成流畅且简洁的摘要。
- 提出一种基于医学命名实体识别(NER)的忠实度评估度量,比较生成摘要中的实体与源笔记中的实体。
- 将ROUGE分数与基于NER的忠实度结合,以评估摘要的流畅性与事实一致性。
- 在MIMIC-III数据集上,使用七种出院摘要部分对五种不同模型(包括RNN+强化学习、BART和Presumm)进行训练与评估。
实验结果
研究问题
- RQ1现有抽象式摘要模型在从先前临床笔记生成出院摘要时,其忠实度表现如何?
- RQ2抽取式-摘要式流水线是否能提升可追溯性并减少多文档临床摘要中的幻觉?
- RQ3与标准的ROUGE度量相比,基于NER的忠实度度量在检测生成摘要中的事实不一致方面有多大的有效性?
- RQ4不同模型架构(如BART与RNN+强化学习)在生成准确、可追溯的出院摘要部分方面表现如何?
- RQ5一种支持证据回退和长上下文处理的流水线能否有效扩展至真实世界的临床会诊数据?
主要发现
- 与端到端的抽象式模型相比,抽取式-摘要式流水线显著提升了忠实度,基于BART的系统在忠实度调整后的F3分数上表现最佳。
- 基于NER的忠实度度量成功识别出幻觉现象,例如在源笔记中提及疾病史时,摘要中却错误声称‘无家族史’。
- BART模型在忠实度调整后的F3度量上优于RNN+强化学习及其他抽象式基线模型,表明其具备更好的事实一致性。
- 尽管性能出色,所有模型仍遗漏了关键临床细节,如‘长期使用硝酸盐治疗的稳定型心绞痛’,表明在捕捉细微临床信息方面仍存在挑战。
- 该流水线通过保留源句子引用,实现了可追溯性,支持临床医生验证,减少了对不可验证模型输出的依赖。
- 基于MIMIC-III构建的数据集为未来临床多文档摘要研究提供了有效的基准,但结果偏向于单一美国医院的ICU数据。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。