Skip to main content
QUICK REVIEW

[论文解读] PULSAR: Pre-training with Extracted Healthcare Terms for Summarising Patients' Problems and Data Augmentation with Black-box Large Language Models

Hao Li, Yuping Wu|arXiv (Cornell University)|Jun 5, 2023
Topic Modeling被引用 5
一句话总结

PULSAR 提出了一种针对临床进展记录中患者问题列表摘要的领域特定预训练目标与数据增强框架。通过结合掩码医疗术语抽取与大语言模型生成的合成数据,其在无需额外标注数据的情况下,在 BioNLP 2023 共享任务中取得 SOTA 表现,排名第二,且在开发数据集上相比更大模型提升了 3.1 个百分点。

ABSTRACT

Medical progress notes play a crucial role in documenting a patient's hospital journey, including his or her condition, treatment plan, and any updates for healthcare providers. Automatic summarisation of a patient's problems in the form of a problem list can aid stakeholders in understanding a patient's condition, reducing workload and cognitive bias. BioNLP 2023 Shared Task 1A focuses on generating a list of diagnoses and problems from the provider's progress notes during hospitalisation. In this paper, we introduce our proposed approach to this task, which integrates two complementary components. One component employs large language models (LLMs) for data augmentation; the other is an abstractive summarisation LLM with a novel pre-training objective for generating the patients' problems summarised as a list. Our approach was ranked second among all submissions to the shared task. The performance of our model on the development and test datasets shows that our approach is more robust on unknown data, with an improvement of up to 3.1 points over the same size of the larger model.

研究动机与目标

  • 通过任务特定的预训练提升从临床进展记录中对患者问题列表进行抽象摘要的能力。
  • 通过利用黑箱大语言模型进行数据增强,减少对大规模标注数据集的依赖。
  • 开发一种与下游临床问题列表生成任务对齐的预训练目标。
  • 评估在有限标注数据下,预训练与数据增强的有效性。
  • 在不使用额外人工标注训练数据的前提下,实现在 BioNLP 2023 共享任务 1A 中的高性能表现。

提出的方法

  • 在 MIMIC-III 进展记录上使用三种掩码策略对编码器-解码器模型进行预训练:空白句子生成、掩码语言建模和掩蔽医疗术语预测。
  • 使用 QuickUMLS 和 i2b2-2010 训练的 NER 模型识别并用哨兵标记替换临床实体以实现掩码。
  • 采用结合空白句子生成与掩码语言建模的双重预训练目标,以提升摘要能力。
  • 利用黑箱大语言模型生成具有三种标签类型的合成数据:与原始输入相同、部分相似或完全不同主题。
  • 使用真实数据与增强数据联合微调预训练模型以完成问题列表生成任务。
  • 使用 ROUGE 分数评估开发集与测试集上的性能,输入变体包括仅 Assessment 与 Assessment+Subjective+Objective。

实验结果

研究问题

  • RQ1一种掩蔽临床术语与文本跨度的新预训练目标,能否提升患者问题列表的抽象摘要性能?
  • RQ2在标注数据有限的情况下,基于大语言模型的数据增强在多大程度上能提升模型性能?
  • RQ3输入长度(如仅 Assessment 与 Assessment+Subjective+Objective)如何影响问题列表生成的模型性能?
  • RQ4随着模型规模增大,数据增强带来的性能增益是否会减弱?
  • RQ5在未见测试数据上,预训练的 PULSAR 模型与 FlanT5 和 ClinicalT5 等强基线模型相比表现如何?

主要发现

  • 尽管仅进行了不到一个完整预训练周期,PULSAR 在开发集上相比 FlanT5-11B 模型提升了 3.1 个 ROUGE 分数。
  • 在官方测试集上,PULSAR 比 ClinicalT5-large 高出 11.2 个 ROUGE 分数,表明其在未知数据上具有强大的泛化能力。
  • 数据增强在各类模型上平均提升了 3 个点性能,其中在较小模型(如 ClinicalT5-large)上提升最大,可达 6 个点。
  • 与仅使用 Assessment 部分相比,将 Subjective 和 Objective 部分作为输入在开发集上提升了 7 个点,在测试集上提升了 2.9 个点。
  • 当输入长度超过 512 个 token 后,性能未进一步提升,表明存在收益递减或长上下文可能造成性能下降。
  • PULSAR-3B 与 PULSAR-11B 之间的性能差距极小,表明该预训练目标使小模型也能在数据有限的情况下实现高性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。