[论文解读] SummQA at MEDIQA-Chat 2023:In-Context Learning with GPT-4 for Medical Summarization
本论文在 MEDIQA-2023 共享任务中提出了一种基于 GPT-4 的上下文学习方法,用于医疗对话摘要生成,采用语义相似度与最大边缘相关性(MMR)筛选少样本示例,实现分节摘要与完整病历摘要。该方法在任务 A(分节摘要)中位列团队第二,在任务 B 的分部摘要中也位列第二,尽管摘要在抽取性忠实度和长度方面存在局限,仍展现出出色的少样本提示性能。
Medical dialogue summarization is challenging due to the unstructured nature of medical conversations, the use of medical terminology in gold summaries, and the need to identify key information across multiple symptom sets. We present a novel system for the Dialogue2Note Medical Summarization tasks in the MEDIQA 2023 Shared Task. Our approach for section-wise summarization (Task A) is a two-stage process of selecting semantically similar dialogues and using the top-k similar dialogues as in-context examples for GPT-4. For full-note summarization (Task B), we use a similar solution with k=1. We achieved 3rd place in Task A (2nd among all teams), 4th place in Task B Division Wise Summarization (2nd among all teams), 15th place in Task A Section Header Classification (9th among all teams), and 8th place among all teams in Task B. Our results highlight the effectiveness of few-shot prompting for this task, though we also identify several weaknesses of prompting-based approaches. We compare GPT-4 performance with several finetuned baselines. We find that GPT-4 summaries are more abstractive and shorter. We make our code publicly available.
研究动机与目标
- 为应对因标注数据有限和隐私约束导致的低资源医疗对话摘要挑战。
- 探索使用 GPT-4 进行少样本上下文学习,从医患对话中生成准确、结构化的 SOAP 病历摘要。
- 通过 MMR 和语义相似度选择语义相关的上下文示例,提升摘要质量。
- 在低资源医疗场景下,将 GPT-4 的零样本与少样本性能与微调模型(如 BART 和 T5)进行对比。
- 分析基于提示的模型的局限性,包括幻觉、随机性以及抽取能力下降等问题。
提出的方法
- 针对分节摘要(任务 A),系统利用句向量和 MMR 从语义上最相似的对话中选取 top-k 示例,作为 GPT-4 的上下文示范。
- 该方法采用两阶段流程:(1) 使用微调后的 BioBERT 进行节标题分类;(2) 使用筛选后的示例进行上下文提示,实现摘要生成。
- 针对完整病历摘要(任务 B),由于 token 长度限制,仅使用 k=1 个上下文示例,通过语义相似度进行选择。
- 系统采用 MiniLM 句向量计算对话与候选示例之间的语义相似度。
- 上下文示例采用输入-输出模板结构,以引导 GPT-4 的生成,温度设置为 0 以减少随机性。
- 该方法结合基于检索的示例选择与 GPT-4 的少样本上下文学习,实现无需微调的摘要生成。
实验结果
研究问题
- RQ1在低资源医疗摘要任务中,基于 GPT-4 的上下文学习能否优于 BART 和 T5 等微调模型?
- RQ2在医疗对话任务中,上下文示例数量(k)如何影响摘要质量?
- RQ3GPT-4 生成的摘要与人类参考摘要相比,在长度、抽取性忠实度和生成性质量方面有何差异?
- RQ4在高风险医疗摘要任务中,基于提示的 LLM 的主要局限性是什么,特别是关于幻觉和一致性问题?
- RQ5在少样本设置中,基于 MMR 的示例选择是否能优于随机选择或非冗余选择,从而提升摘要质量?
主要发现
- 该系统在整体中位列第三,在任务 A(分节摘要)中位列团队第二,证明了其出色的少样本性能。
- 在任务 B 的分部摘要中,系统整体位列第四,团队中位列第二,证实其在完整病历生成中的有效性。
- 增加上下文示例数量(k)使 ROUGE-L 从 40.3(k=3)提升至 42.8(k=7),表明性能持续提升。
- GPT-4 生成的摘要显著短于人类参考摘要和微调模型,且更具生成性,表明其抽取性忠实度较低。
- 尽管性能优异,系统在温度设置为 0 的情况下仍表现出输出随机性,凸显了上下文学习的不稳定性。
- 该方法揭示了伦理风险,包括幻觉和隐私问题,因此需要事后事实核查及严格的 HIPAA 合规性保障。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。