[论文解读] RadAdapt: Radiology Report Summarization via Lightweight Domain Adaptation of Large Language Models
RadAdapt 提出了一种轻量级的领域自适应框架,用于放射科报告摘要生成,采用临床文本预训练的大语言模型(LLM)并通过 LoRA 进行微调,仅更新 0.32% 的参数,即实现了最先进(SOTA)的性能表现。该方法优于全参数微调和提示工程基线模型,表明结合临床预训练与参数高效微调是放射科报告摘要(RRS)任务的最优策略。
We systematically investigate lightweight strategies to adapt large language models (LLMs) for the task of radiology report summarization (RRS). Specifically, we focus on domain adaptation via pretraining (on natural language, biomedical text, or clinical text) and via discrete prompting or parameter-efficient fine-tuning. Our results consistently achieve best performance by maximally adapting to the task via pretraining on clinical text and fine-tuning on RRS examples. Importantly, this method fine-tunes a mere 0.32% of parameters throughout the model, in contrast to end-to-end fine-tuning (100% of parameters). Additionally, we study the effect of in-context examples and out-of-distribution (OOD) training before concluding with a radiologist reader study and qualitative analysis. Our findings highlight the importance of domain adaptation in RRS and provide valuable insights toward developing effective natural language processing solutions for clinical tasks.
研究动机与目标
- 研究使用大语言模型(LLM)进行放射科报告摘要(RRS)的轻量级领域自适应策略。
- 评估在自然语言、生物医学或临床文本上预训练对 RRS 性能的影响。
- 从有效性与效率角度,比较离散提示(prompting)、参数高效微调(LoRA)与端到端微调的性能表现。
- 评估模型在分布外(OOD)影像模态与解剖部位上的泛化能力。
- 通过放射科医生阅读评估与定性分析,验证模型性能。
提出的方法
- 在临床文本(如 MIMIC-III)上预训练 LLM,以提升放射科报告的领域对齐性。
- 采用 LoRA(低秩自适应)实现参数高效的微调,仅更新 0.32% 的模型参数。
- 使用少样本 few-shot 提示(in-context prompting),通过不同数量的示例评估提示工程的影响。
- 在分布外(OOD)数据上评估模型泛化能力,特别关注不同影像模态与解剖区域的表现。
- 开展放射科医生阅读评估,从正确性、连贯性与临床相关性角度评估生成印象的质量。
- 通过消融研究分析模型架构、提示策略与自适应技术,以识别性能提升的关键驱动因素。

实验结果
研究问题
- RQ1与通用或生物医学预训练相比,临床文本预训练是否显著提升 RRS 性能?
- RQ2在 RRS 任务中,基于 LoRA 的参数高效微调与全参数微调相比,在性能与参数效率方面表现如何?
- RQ3在不同 LLM 上,上下文少样本提示对 RRS 输出质量的影响如何?
- RQ4经过微调的模型在分布外(OOD)影像模态与解剖区域上的泛化能力如何?
- RQ5放射科医生如何评估 LLM 生成的放射科印象在临床相关性、正确性与连贯性方面的表现?
主要发现
- 表现最佳的方法是结合临床文本预训练(Clin-T5)与 LoRA 微调,在 RRS 基准测试中达到最先进性能。
- 通过 LoRA 仅微调 0.32% 的模型参数,性能优于全参数微调(100% 参数更新),同时显著降低计算成本。
- 增加上下文示例数量可一致提升所有评估模型的 RRS 性能,凸显提示工程的价值。
- 解剖多样性比模态类型对泛化能力的影响更大;在多种解剖部位上训练的模型对 OOD 情况的泛化能力更强。
- 放射科医生阅读评估显示,模型在正确性、连贯性与临床相关性方面得分较高,但偶尔仍存在幻觉现象及与参考报告不一致的情况。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。