[论文解读] Enhancing disease detection in radiology reports through fine-tuning lightweight LLM on weak labels
本文提出对轻量级大语言模型(Llama 3.1-8B)进行微调,利用弱标签放射科报告以提升疾病检测能力。通过联合训练多项选择分类任务与开放式检测任务,使用GPT-4o生成的合成标签或基于规则的系统生成的标签,该模型在开放式检测任务上实现了0.91的micro-F1,且性能超越了其噪声较大的教师模型,展现出在低资源、隐私保护型医疗大语言模型专业化方面的强大潜力。
Despite significant progress in applying large language models (LLMs) to the medical domain, several limitations still prevent them from practical applications. Among these are the constraints on model size and the lack of cohort-specific labeled datasets. In this work, we investigated the potential of improving a lightweight LLM, such as Llama 3.1-8B, through fine-tuning with datasets using synthetic labels. Two tasks are jointly trained by combining their respective instruction datasets. When the quality of the task-specific synthetic labels is relatively high (e.g., generated by GPT4-o), Llama 3.1-8B achieves satisfactory performance on the open-ended disease detection task, with a micro F1 score of 0.91. Conversely, when the quality of the task-relevant synthetic labels is relatively low (e.g., from the MIMIC-CXR dataset), fine-tuned Llama 3.1-8B is able to surpass its noisy teacher labels (micro F1 score of 0.67 v.s. 0.63) when calibrated against curated labels, indicating the strong inherent underlying capability of the model. These findings demonstrate the potential offine-tuning LLMs with synthetic labels, offering a promising direction for future research on LLM specialization in the medical domain.
研究动机与目标
- 通过利用合成标签进行模型微调,解决放射科中有限且低质量标注数据的挑战。
- 通过使用Llama 3.1-8B等轻量级模型,克服医院中大型大语言模型的限制。
- 评估弱监督微调是否能匹配或超越人工标注或基于规则的标签的性能。
- 研究单一大语言模型在多个放射科任务上进行联合微调与独立微调的对比。
- 证明使用GPT-4o生成的合成标签训练轻量级模型,可实现接近专家水平的疾病检测性能。
提出的方法
- 在两项不同的放射科任务上对Llama 3.1-8B进行微调:多项选择疾病分类与开放式疾病检测,采用指令微调方法。
- 使用Negbio(一个基于规则的系统)为多项选择任务生成合成标签,使用GPT-4o为开放式任务生成合成标签。
- 将来自不同来源(MIMIC-CXR和WCM)的指令数据集合并为一个混合训练集,用于联合多任务学习。
- 采用精心设计的提示进行指令微调,包含否定处理、置信度过滤和证据提取。
- 使用经过筛选的人工标注测试集上的micro-F1分数评估模型性能,并与基于规则的标签和GPT-4o输出进行比较。
- 探索联合微调与独立微调策略,以评估不同任务间的性能权衡。
实验结果
研究问题
- RQ1当在合成标签上进行微调时,像Llama 3.1-8B这样的轻量级大语言模型是否能在放射科疾病检测中实现高性能?
- RQ2与独立训练相比,对多个任务进行联合微调是否能提升模型的泛化能力?
- RQ3当教师模型使用噪声或不完美的标签时,学生模型是否能超越其性能?
- RQ4合成标签的质量(例如来自GPT-4o与基于规则的系统)如何影响下游模型的性能?
- RQ5在低资源、隐私敏感的医疗环境中,合成标签在多大程度上能实现大语言模型的有效专业化?
主要发现
- 当在GPT-4o生成的合成标签上进行微调时,Llama 3.1-8B在开放式疾病检测任务上实现了0.91的micro-F1分数。
- 在多项选择分类任务上,微调后的Llama 3.1-8B性能优于其基于规则的教师模型(NegBio),micro-F1分别为0.66与0.63。
- 当在MIMIC-CXR生成的低质量合成标签上进行训练时,微调后的Llama 3.1-8B仍优于噪声较大的教师模型,表明其具备强大的模型泛化能力。
- 在两个任务上进行联合微调的性能与独立训练相当,表明多任务学习未造成显著性能下降。
- 该模型对标签噪声表现出强鲁棒性,即使在使用不完美的合成标签进行训练时仍能实现高性能,凸显其在医疗自然语言处理任务中的内在能力。
- 结果表明,来自高质量大语言模型(如GPT-4o)的合成标签可有效传递专家级知识至轻量级模型,使其在临床环境中具备实际部署潜力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。