Skip to main content
QUICK REVIEW

[论文解读] PULSAR at MEDIQA-Sum 2023: Large Language Models Augmented by Synthetic Dialogue Convert Patient Dialogues to Medical Records

Viktor Schlegel, Hao Li|arXiv (Cornell University)|Jul 5, 2023
Machine Learning in HealthcareComputer Science被引用 3
一句话总结

本文提出 PULSAR,一种大型语言模型框架,通过领域特定预训练和合成数据增强,将患者-医生对话转化为临床记录。尽管预训练和数据增强带来的性能提升有限,但模型规模的扩展带来了最显著的性能改进,在 MEDIQA-Sum 2023 挑战赛任务 B 中取得第二名和第三名的成绩。

ABSTRACT

This paper describes PULSAR, our system submission at the ImageClef 2023 MediQA-Sum task on summarising patient-doctor dialogues into clinical records. The proposed framework relies on domain-specific pre-training, to produce a specialised language model which is trained on task-specific natural data augmented by synthetic data generated by a black-box LLM. We find limited evidence towards the efficacy of domain-specific pre-training and data augmentation, while scaling up the language model yields the best performance gains. Our approach was ranked second and third among 13 submissions on task B of the challenge. Our code is available at https://github.com/yuping-wu/PULSAR.

研究动机与目标

  • 研究领域特定预训练和数据增强在适应大型语言模型用于临床对话摘要任务中的有效性。
  • 评估统一的 LLM 框架是否能在极少适应的情况下泛化至新的医疗 NLP 任务。
  • 通过将患者-医生对话转化为结构化医疗记录部分,提升临床文档自动化的水平。
  • 评估模型规模、预训练和数据增强对医疗环境中抽象摘要性能的影响。
  • 探索使用黑箱 LLM 生成合成数据以增强低资源医疗 NLP 任务的可行性。

提出的方法

  • 使用一种重建从真实临床记录中提取的伪摘要医学术语的预训练目标,微调大型语言模型。
  • 通过使用指令模板提示黑箱 LLM(如 GPT-3.5)生成合成训练数据,创建特定任务的对话-记录配对。
  • 采用基于适配器的微调方法,仅更新一小部分参数(7B 模型的 1.1%),实现在计算成本更低的情况下高效适应。
  • 在任务 B 和 C 的真实数据与增强数据上,使用 ROUGE、ROUGE-L 和 ROUGE-LSum 指标评估性能。
  • 通过比较不同规模(如 3B、11B)和训练策略(全参数微调 vs. 适配器微调)的模型变体,分离出规模和适应策略的影响。
  • 采用两阶段训练流程:首先在医学术语重建任务上进行预训练,然后在真实和合成数据上进行对话-记录生成的微调。
Figure 1: Example of the pre-train objective of PULSAR. Both Masked Language Model (MLM) and Gap Sentences Generation (GSG) have been employed in this scenario. Red and orange arrows exemplify the UMLS and N2C2 MLM masking strategy, respectively. Meanwhile, the black arrow shows the GSG masking stra
Figure 1: Example of the pre-train objective of PULSAR. Both Masked Language Model (MLM) and Gap Sentences Generation (GSG) have been employed in this scenario. Red and orange arrows exemplify the UMLS and N2C2 MLM masking strategy, respectively. Meanwhile, the black arrow shows the GSG masking stra

实验结果

研究问题

  • RQ1领域特定预训练是否能提升临床对话摘要任务中的零样本或少样本性能?
  • RQ2当真实训练数据有限时,合成数据增强在多大程度上能提升模型泛化能力?
  • RQ3与适配器等架构适应方法相比,模型规模在对话-医疗记录生成任务中的性能影响如何?
  • RQ4一个单一的 LLM 框架是否能在无需任务特定微调的情况下,有效泛化至 MEDIQA-Sum 挑战赛的多个子任务?
  • RQ5解码超参数和提示工程如何影响临床摘要生成质量与幻觉率?

主要发现

  • 将模型规模从 3B 参数扩展到 11B 参数带来了最显著的性能提升,11B 模型在所有指标上均优于较小的变体。
  • 11B 模型在 MEDIQA-Sum 2023 挑战赛任务 B 中获得第二名和第三名,表明其在极少任务特定适应下仍具备强大泛化能力。
  • 数据增强使测试集上的性能提升了 1.77 ROUGE-1、1.81 ROUGE-2、2.94 ROUGE-L 和 2.45 ROUGE-LSum 分数,尤其对较小模型有显著帮助。
  • 尽管有所改进,但数据增强对大模型(如 3B 模型)的性能提升不显著,表明在真实数据充足时已达到性能饱和。
  • 适配器微调取得了合理性能,但即使在小模型上也表现不如全参数微调,表明全参数更新更有效。
  • 模型表现出典型的生成问题,如幻觉和输入复制,这些在数据增强的辅助下得到缓解,尤其是在任务 C 等低数据场景中。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。