[论文解读] SoftTiger: A Clinical Foundation Model for Healthcare Workflows
SoftTiger 是一个在 MIMIC-IV 中去标识化、经认证的临床笔记上微调的 13B 和 70B 参数临床基础模型,可将非结构化临床叙述转化为符合 FHIR 标准的结构化数据(例如,国际患者摘要、临床印象、医疗会诊)。它在临床笔记处理任务中达到最先进性能,优于开源模型和 GPT-3.5,与 Gemini-Pro 性能相当,与 GPT-4 的差距极小,同时支持最长 8k 个 token 的上下文窗口。
We introduce SoftTiger, a clinical large language model (CLaM) designed as a foundation model for healthcare workflows. The narrative and unstructured nature of clinical notes is a major obstacle for healthcare intelligentization. We address a critical problem of structuring clinical notes into clinical data, according to international interoperability standards. We collect and annotate data for three subtasks, namely, international patient summary, clinical impression and medical encounter. We then supervised fine-tuned a state-of-the-art LLM using public and credentialed clinical data. The training is orchestrated in a way that the target model can first support basic clinical tasks such as abbreviation expansion and temporal information extraction, and then learn to perform more complex downstream clinical tasks. Moreover, we address several modeling challenges in the healthcare context, e.g., extra long context window. Our blind pairwise evaluation shows that SoftTiger outperforms other popular open-source models and GPT-3.5, comparable to Gemini-pro, with a mild gap from GPT-4. We believe that LLMs may become a step-stone towards healthcare digitalization and democratization. Therefore, we publicly release SoftTiger models at scales of 13 billion and 70 billion parameters, as well as datasets and code for our innovative scalable evaluation, hopefully, making a significant contribution to the healthcare industry.
研究动机与目标
- 解决利用大语言模型将非结构化临床笔记转化为标准化、可互操作临床数据的关键挑战。
- 开发一种轻量级、高效的临床大语言模型微调流程,支持基础任务(如缩写展开)和复杂临床工作流程任务。
- 通过在长达 8k 个 token 的长上下文临床数据和精心整理的标注数据上进行训练,克服上下文长度限制和医学术语理解不足的问题。
- 通过公开发布 13B 和 70B 参数模型、数据集和评估代码,推动医疗数字化和普惠化。
- 通过人工参与验证、伦理审查和遵循 FHIR 标准,确保模型的安全性、可靠性和监管合规性。
提出的方法
- 在 MIMIC-IV 的公开和经认证的临床数据上微调一个最先进的一般用途大语言模型,重点是将临床笔记结构化为符合 FHIR 标准的实体。
- 设计分阶段训练策略:首先支持基础任务(如时间信息提取、缩写展开),然后逐步过渡到复杂临床数据结构化。
- 在训练期间将上下文窗口扩展至 8k 个 token,以避免推理阶段因长度外推导致的分辨率损失。
- 通过 GPT-4 和专家医生评审对 100 份临床笔记进行标注,创建高质量、与 FHIR 对齐的数据集,用于训练和评估。
- 实施可扩展的开源评估框架,采用大语言模型作为裁判,并使用 ChatbotArena 风格的成对比较方法进行模型基准测试。
- 集成安全与可靠性协议,包括人工评估和伦理委员会合规性,以支持真实临床环境中的部署。

实验结果
研究问题
- RQ1临床基础模型能否有效将非结构化临床笔记转化为标准化、可互操作的符合 FHIR 的数据?
- RQ2与现有开源和专有模型相比,长上下文微调的大语言模型在复杂临床数据结构化任务中的表现如何?
- RQ3分阶段训练方法在提升基础和高级临床任务性能方面有多大改善作用?
- RQ4在临床工作流程中使用时,模型输出的可靠性和安全性如何,特别是在术语映射和患者数据隐私方面?
- RQ5精心整理的专家标注数据对模型在多样化临床笔记类型上的泛化能力和性能有多大影响?
主要发现
- 在盲评成对比较中,SoftTiger 表现优于其他开源大语言模型和 GPT-3.5,性能与 Gemini-Pro 相当,与 GPT-4 的差距极小。
- 该模型在长上下文临床笔记上表现出色,通过在训练阶段使用最长 8k 个 token 的上下文窗口,避免推理阶段的外推,从而保持分辨率和准确性。
- 分阶段训练方法成功使模型先掌握基础临床任务(如缩写展开、时间信息提取),再逐步处理复杂的数据结构化任务。
- 公开发布的 13B 和 70B 参数模型、数据集和评估代码已发布在 Hugging Face 和 PhysioNet,支持可复现性和社区扩展。
- 模型输出与 FHIR 标准(如国际患者摘要、临床印象、医疗会诊)对齐,确保与现有电子健康记录系统互操作。
- 本研究强调了专家标注数据和人工参与验证的重要性,未来工作预计将提升数据整理透明度和标注者间一致性指标。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。