Skip to main content
QUICK REVIEW

[论文解读] shs-nlp at RadSum23: Domain-Adaptive Pre-training of Instruction-tuned LLMs for Radiology Report Impression Generation

Sanjeev Kumar Karn, Rikhiya Ghosh|arXiv (Cornell University)|Jun 5, 2023
Topic Modeling被引用 5
一句话总结

本文提出了一种新颖的领域自适应预训练方法——general-pretrain-prompt-tune-and-special-pretrain,其中将已指令微调的大型语言模型(Bloomz)在MIMIC-IV中的放射科特定文本上进一步预训练,以提升放射科报告印象生成的效果。该方法在无需任务特定微调的情况下,实现了零样本性能的最先进水平,在BioNLP 2023研讨会的任务1B中排名第一。

ABSTRACT

Instruction-tuned generative Large language models (LLMs) like ChatGPT and Bloomz possess excellent generalization abilities, but they face limitations in understanding radiology reports, particularly in the task of generating the IMPRESSIONS section from the FINDINGS section. They tend to generate either verbose or incomplete IMPRESSIONS, mainly due to insufficient exposure to medical text data during training. We present a system which leverages large-scale medical text data for domain-adaptive pre-training of instruction-tuned LLMs to enhance its medical knowledge and performance on specific medical tasks. We show that this system performs better in a zero-shot setting than a number of pretrain-and-finetune adaptation methods on the IMPRESSIONS generation task, and ranks 1st among participating systems in Task 1B: Radiology Report Summarization at the BioNLP 2023 workshop.

研究动机与目标

  • 解决指令微调的大型语言模型因缺乏对医学文本的充分暴露,导致在生成准确、简洁的放射科报告印象方面存在的局限性。
  • 克服标准预训练-微调方法在低资源医学NLP场景下的不足。
  • 探究在指令微调后对领域特定文本进行额外预训练,是否能提升在放射科报告摘要任务上的零样本性能。
  • 证明即使不进行任务特定的微调,领域自适应预训练也能优于基于微调的方法。

提出的方法

  • 以一个已预训练且经过指令微调的大型语言模型(Bloomz)为起点,该模型已学习在多种自然语言处理任务中遵循自然语言指令。
  • 在大规模放射科报告语料库(MIMIC-IV)上进行额外的领域特定预训练,以使模型适应放射科术语和报告结构。
  • 在整个训练阶段(通用预训练、提示微调和领域特定预训练)保持相同的语言建模目标,以确保一致性。
  • 使用所得模型(命名为RadBloomz)在无需进一步微调的情况下,对放射科报告印象生成进行零样本推理。
  • 在MIMIC-III和MIMIC-CXR测试集上,使用标准指标(ROUGE-L、BERTScore、F1-RadGraph、F1-CheXbert)评估性能。
  • 将领域自适应模型的零样本性能与相同评估数据上的标准预训练-微调基线模型进行比较。

实验结果

研究问题

  • RQ1在领域特定的放射科文本上对已指令微调的大型语言模型进行进一步预训练,是否能提升其在放射科报告印象生成任务上的零样本性能?
  • RQ2所提出的general-pretrain-prompt-tune-and-special-pretrain范式是否在零样本设置下优于传统的预训练-微调方法?
  • RQ3该领域自适应模型在标准放射科报告摘要评估指标上的表现,与微调模型相比如何?
  • RQ4在医学NLP任务中,领域自适应预训练在多大程度上减少了对任务特定微调的需求?
  • RQ5该模型在生成无异常或不同报告风格的报告印象时,其失败模式和局限性是什么?

主要发现

  • 所提出的领域自适应预训练方法在BioNLP 2023研讨会的任务1B:放射科报告摘要中,所有提交系统中表现最佳,隐藏测试集排名第一。
  • 该零样本模型在MIMIC-III测试集上的ROUGE-L、BERTScore、F1-RadGraph和F1-CheXbert指标上,优于多个预训练-微调基线模型。
  • 尽管微调提升了部分指标(如ROUGE-L),但微调模型在F1-RadGraph和F1-CheXbert指标上表现更差,表明在不进行微调的情况下,领域适应更有利于语义一致性。
  • 该模型在MIMIC-CXR测试集上表现出色(在纯文本系统中排名第四),表明其在多模态设置下也具有鲁棒性。
  • 错误分析显示,基于n-gram的指标(如ROUGE)在“正常MRI”与“阴性研究”等情况下无法捕捉语义相似性,凸显了当前评估协议的局限性。
  • 该模型偶尔会产生幻觉或不完整的印象,尤其是在发现模糊或缺乏明显异常时,表明在事实一致性方面仍有改进空间。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。