[论文解读] Publicly Shareable Clinical Large Language Model Built on Synthetic Clinical Notes
本文介绍了 Asclepius,一个仅基于从公开病例报告生成的 158,000 份合成临床笔记训练而成的公开可共享临床大语言模型。尽管仅使用合成数据进行训练,Asclepius 在多种临床 NLP 任务的零样本评估中表现与 GPT-3.5-turbo 及基于真实临床笔记训练的模型相当,证明了合成数据可作为训练高性能、符合隐私要求的临床大语言模型的有效替代方案。
The development of large language models tailored for handling patients' clinical notes is often hindered by the limited accessibility and usability of these notes due to strict privacy regulations. To address these challenges, we first create synthetic large-scale clinical notes using publicly available case reports extracted from biomedical literature. We then use these synthetic notes to train our specialized clinical large language model, Asclepius. While Asclepius is trained on synthetic data, we assess its potential performance in real-world applications by evaluating it using real clinical notes. We benchmark Asclepius against several other large language models, including GPT-3.5-turbo and other open-source alternatives. To further validate our approach using synthetic notes, we also compare Asclepius with its variants trained on real clinical notes. Our findings convincingly demonstrate that synthetic clinical notes can serve as viable substitutes for real ones when constructing high-performing clinical language models. This conclusion is supported by detailed evaluations conducted by both GPT-4 and medical professionals. All resources including weights, codes, and data used in the development of Asclepius are made publicly accessible for future research. (https://github.com/starmpcc/Asclepius)
研究动机与目标
- 为解决因严格的隐私法规导致在训练临床大语言模型时难以获取真实临床笔记的问题。
- 开发一种高性能、可本地部署的临床大语言模型,可在离线环境中运行,确保医院环境中的数据隐私。
- 评估合成临床笔记是否可作为训练高效临床大语言模型的真实临床数据的可行替代品。
- 通过公开发布模型权重、代码和合成训练数据,实现开放、可复现的研究。
- 评估该模型在真实世界临床笔记上执行多种 NLP 任务的零样本性能。
提出的方法
- 使用 GPT-3.5-turbo 从 158,000 份从 PubMed Central(PMC-Patients)提取的匿名病例报告中生成合成临床笔记。
- 通过医学专业人员参与提示调优,使用 GPT-3.5-turbo 创建指令-回答对,以确保临床准确性和相关性。
- 使用基于 Transformer 的架构,对 Asclepius-7B 和 Asclepius-13B 模型在合成指令遵循数据集上进行微调。
- 在 MIMIC-III、MIMIC-IV、i2b2、CASI 和 MTSamples 的真实临床笔记上评估模型的零样本性能。
- 评估包括与 GPT-3.5-turbo 及多个开源大语言模型的比较,采用自动化基准测试和临床医生评估相结合的方式。
- 所有模型权重、代码和合成数据均在 GitHub 上公开发布,以支持可复现性和未来研究。
实验结果
研究问题
- RQ1仅基于合成临床笔记训练的临床大语言模型能否实现与基于真实临床数据训练的模型相当的性能?
- RQ2像 Asclepius 这类基于合成数据训练的模型在真实世界临床 NLP 任务的零样本设置下表现如何?
- RQ3在训练高性能临床大语言模型时,合成临床笔记在多大程度上可作为真实临床数据的可行、符合隐私要求的替代方案?
- RQ4当在真实临床笔记上评估时,基于合成数据训练的模型性能是否与基于真实数据训练的模型存在显著差异?
- RQ5一个可本地部署的临床大语言模型是否能实现与 GPT-3.5-turbo 等基于 API 的模型相当的性能,同时确保数据隐私与安全?
主要发现
- Asclepius 在多个临床 NLP 基准测试中表现与 GPT-3.5-turbo 相当,包括在真实临床笔记上的零样本任务。
- 经 GPT-4 和临床医生评估验证,基于合成数据训练的模型与基于真实临床笔记训练的模型相比,性能差距不显著。
- Asclepius 在 MIMIC-III、MIMIC-IV、i2b2、CASI 和 MTSamples 的多种临床笔记类型中均展现出强大的零样本泛化能力。
- 使用合成数据使得模型权重、代码和训练数据可完全公开发布,推动了临床人工智能领域开放且可复现的研究。
- 临床医生评估确认了模型输出的临床相关性和准确性,进一步验证了合成数据方法的有效性。
- Asclepius 是首个能够在一个完全基于合成数据训练的本地可部署模型中,同时处理多种临床 NLP 任务的临床大语言模型。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。