[论文解读] SPeC: A Soft Prompt-Based Calibration on Performance Variability of Large Language Model in Clinical Notes Summarization
本文提出 SPeC,一种与模型无关的基于软提示的校准框架,可降低大型语言模型(LLM)在临床笔记摘要任务中的性能波动,同时保持基于提示的性能优势。通过在嵌入空间中与离散提示交互的可学习、分布内软提示,SPeC 在 Flan-T5 上将输出方差降低了高达 43.1%,从而实现更一致、更可靠的医学摘要生成,且在训练过程中无需使用标准参考答案。
Electronic health records (EHRs) store an extensive array of patient information, encompassing medical histories, diagnoses, treatments, and test outcomes. These records are crucial for enabling healthcare providers to make well-informed decisions regarding patient care. Summarizing clinical notes further assists healthcare professionals in pinpointing potential health risks and making better-informed decisions. This process contributes to reducing errors and enhancing patient outcomes by ensuring providers have access to the most pertinent and current patient data. Recent research has shown that incorporating prompts with large language models (LLMs) substantially boosts the efficacy of summarization tasks. However, we show that this approach also leads to increased output variance, resulting in notably divergent outputs even when prompts share similar meanings. To tackle this challenge, we introduce a model-agnostic Soft Prompt-Based Calibration (SPeC) pipeline that employs soft prompts to diminish variance while preserving the advantages of prompt-based summarization. Experimental findings on multiple clinical note tasks and LLMs indicate that our method not only bolsters performance but also effectively curbs variance for various LLMs, providing a more uniform and dependable solution for summarizing vital medical information.
研究动机与目标
- 解决在使用人工设计的指令提示进行临床笔记摘要时,LLM 生成摘要的高性能波动问题。
- 克服因提示微小变化导致摘要输出显著不同的不稳定性问题。
- 开发一种与模型无关的校准方法,在保持基于提示摘要优势的同时,提升不同 LLM 之间的输出一致性。
- 通过降低对提示工程选择的敏感性,使非 NLP 专家能够可靠地使用 LLM 进行临床摘要。
- 确保该方法为零样本设置,且在训练过程中无需使用标准摘要,从而提升在医疗环境中的实际可用性。
提出的方法
- 引入一个软提示编码器,其可学习参数在标记嵌入空间中与离散指令提示进行交互。
- 使用来自 LLM 词汇表的分布内软提示标记,而非分布外标记,以提升稳定性和性能。
- 以零样本方式训练软提示编码器,优化过程中无需使用真实摘要。
- 通过微调软提示参数来最小化输出方差,同时保持临床摘要任务上的平均性能,实现 LLM 输出的校准。
- 在多个 LLM 和临床笔记数据集上应用 SPeC 框架,包括 MIMIC-CXR 的放射科报告。
- 使用 ROUGE 指标(ROUGE-1、ROUGE-2、ROUGE-L)评估性能,以衡量平均性能和输出方差的降低。
实验结果
研究问题
- RQ1与标准离散提示相比,基于软提示的校准在多大程度上降低了 LLM 生成的临床笔记摘要的性能波动?
- RQ2软提示标记分布的选择(分布内 vs. 分布外)如何影响摘要性能和方差降低效果?
- RQ3零样本、与模型无关的软提示校准框架是否能在不使用训练期间标准摘要的前提下,保持高摘要质量?
- RQ4SPeC 是否能在保持或提升平均性能的同时,提高不同 LLM 在临床笔记摘要任务中的输出一致性?
- RQ5SPeC 在真实临床数据集(如 MIMIC-CXR)上的方差降低效果如何,特别是在标准化报告(如放射科报告)中?
主要发现
- 在使用分布内软提示标记时,SPeC 在 Flan-T5 模型上将输出方差降低了高达 43.1%,显著提升了输出一致性。
- 使用分布内软提示标记可使 ROUGE-1 的标准差降低 38.2%,ROUGE-2 降低 38.7%,ROUGE-L 降低 43.1%,优于分布外标记。
- SPeC 在大幅降低方差(标准差从 0.0079 降至 0.0045)的同时,仍保持了较高的平均性能(如 ROUGE-L 平均值为 0.4973)。
- 尽管分布外软提示仍能将方差降低 19.7% 至 22.5%,但其性能始终低于使用分布内标记的情况。
- 该框架在多个 LLM 和临床摘要任务中均表现有效,展现出良好的泛化能力和鲁棒性。
- SPeC 在无需训练期间使用标准摘要的前提下,实现了可靠且一致的摘要生成,使其在真实医疗场景中部署更具实用性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。