Skip to main content
QUICK REVIEW

[论文解读] Attend to Medical Ontologies: Content Selection for Clinical Abstractive Summarization

Sajad Sotudeh, Nazli Goharian|arXiv (Cornell University)|May 1, 2020
Topic Modeling参考文献 28被引用 8
一句话总结

该论文提出了一种新颖的序列到序列(seq2seq)模型,通过识别并整合放射科报告发现中的关键医学本体术语,以增强临床生成式摘要的质量。该模型利用BERT嵌入作为输入,通过双向LSTM序列标注器预测术语复制到‘印象’部分的可能性,从而改进内容选择。在MIMIC-CXR和OpenI数据集上,与最先进基线相比,该模型在ROUGE-1、ROUGE-2和ROUGE-L指标上分别实现了2.9%、2.5%和1.9%的统计显著提升。

ABSTRACT

Sequence-to-sequence (seq2seq) network is a well-established model for text summarization task. It can learn to produce readable content; however, it falls short in effectively identifying key regions of the source. In this paper, we approach the content selection problem for clinical abstractive summarization by augmenting salient ontological terms into the summarizer. Our experiments on two publicly available clinical data sets (107,372 reports of MIMIC-CXR, and 3,366 reports of OpenI) show that our model statistically significantly boosts state-of-the-art results in terms of Rouge metrics (with improvements: 2.9% RG-1, 2.5% RG-2, 1.9% RG-L), in the healthcare domain where any range of improvement impacts patients' welfare.

研究动机与目标

  • 为解决临床生成式摘要中的内容选择挑战,即标准seq2seq模型难以从放射科报告中识别出关键信息。
  • 通过仅整合来自‘发现’部分中最相关的本体术语,提升‘印象’生成质量,以支持临床决策。
  • 评估通过关键本体术语优化词表示是否能带来优于使用所有本体术语的摘要质量提升。
  • 评估该模型在不同临床数据集(MIMIC-CXR和OpenI)之间的跨机构可迁移性。
  • 通过自动指标(ROUGE)和专家人工评估(可读性、准确性、完整性)双重验证模型性能。

提出的方法

  • 将内容选择建模为词级别序列标注任务,其中‘发现’中的每个术语若为关键本体术语且将被直接复制到‘印象’中,则标记为1。
  • 使用BERT嵌入作为双向LSTM网络的输入,以预测每个词的复制可能性,作为其显著性的代理指标。
  • 通过交叉熵损失函数训练内容选择器,以最大化正确标注预测的对数似然。
  • 通过为这些关键术语设计的独立编码器,对‘发现’部分的词表示进行优化,从而将关键本体术语整合到摘要器中。
  • 采用标准的seq2seq模型,结合pointer-generator注意力机制,使解码器同时关注优化后的‘发现’内容和关键本体术语。
  • 在MIMIC-CXR和OpenI数据集上应用训练好的模型,通过ROUGE和专家人工标注进行评估。

实验结果

研究问题

  • RQ1能否通过识别并仅整合来自放射科报告‘发现’部分中最具显著性的本体术语,来提升生成式摘要的性能?
  • RQ2通过为关键本体术语设计专用编码器来优化词表示,是否能带来优于使用所有本体术语的摘要质量提升?
  • RQ3在临床摘要基准测试中,所提模型与最先进基线相比,在ROUGE分数上的表现如何?
  • RQ4该模型在不同临床机构和数据集之间的可迁移性如何?
  • RQ5专家标注的摘要与系统生成的摘要在可读性、准确性和完整性方面有何差异?

主要发现

  • 在MIMIC-CXR数据集上,所提模型相比强基线模型,ROUGE-1绝对提升2.9%,ROUGE-2提升2.5%,ROUGE-L提升1.9%。
  • 内容选择器显著提升了摘要性能,配对t检验结果显示ROUGE-1和ROUGE-2的p值均小于0.05。
  • 在OpenI数据集上,该模型显著优于表现最佳的生成式基线模型,展现出强大的跨机构可迁移性。
  • 在专家评估中,81%的系统生成‘印象’在可读性、准确性和完整性三项指标上被评为与人工撰写版本相当或更优。
  • 73%的系统生成‘印象’在可读性上获得最高分(3分),71%在准确性上获得最高分,62%在完整性上获得最高分,表明其性能接近人类水平,且评分者间一致性中等(Fleiss’ Kappa:47–52%)。
  • 该模型在不同数据集上表现稳健,ROUGE指标和专家评估结果均持续提升,表明其在临床环境中的实际应用潜力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。