[论文解读] Hippocrates: An Open-Source Framework for Advancing Large Language Models in Healthcare
Hippocrates 是一个用于训练和评估医疗大语言模型的开源框架,提供训练数据、代码、检查点和评估协议的完全访问权限。它推出了 Hippo 系列 70 亿参数模型,通过持续预训练、指令微调以及从人类和人工智能反馈中强化学习进行微调,在医疗基准测试中达到最先进性能——在 MedQA 和 USMLE 考试中甚至超越了 700 亿参数模型。
The integration of Large Language Models (LLMs) into healthcare promises to transform medical diagnostics, research, and patient care. Yet, the progression of medical LLMs faces obstacles such as complex training requirements, rigorous evaluation demands, and the dominance of proprietary models that restrict academic exploration. Transparent, comprehensive access to LLM resources is essential for advancing the field, fostering reproducibility, and encouraging innovation in healthcare AI. We present Hippocrates, an open-source LLM framework specifically developed for the medical domain. In stark contrast to previous efforts, it offers unrestricted access to its training datasets, codebase, checkpoints, and evaluation protocols. This open approach is designed to stimulate collaborative research, allowing the community to build upon, refine, and rigorously evaluate medical LLMs within a transparent ecosystem. Also, we introduce Hippo, a family of 7B models tailored for the medical domain, fine-tuned from Mistral and LLaMA2 through continual pre-training, instruction tuning, and reinforcement learning from human and AI feedback. Our models outperform existing open medical LLMs models by a large-margin, even surpassing models with 70B parameters. Through Hippocrates, we aspire to unlock the full potential of LLMs not just to advance medical knowledge and patient care but also to democratize the benefits of AI research in healthcare, making them available across the globe.
研究动机与目标
- 解决因依赖专有模型和封闭数据集而导致的医疗大语言模型开发中透明度不足和可复现性差的问题。
- 克服训练医疗大语言模型的复杂性和难以访问的问题,从而促进学术合作与基准测试。
- 通过以开源模式发布所有组件——数据、代码、检查点和评估协议——实现高质量医疗大语言模型的普及化。
- 构建一个稳健、透明的医疗大语言模型训练流程,支持在多样化临床推理任务中进行严格且可复现的评估。
- 通过从人工智能生成的反馈中进行强化学习(RLAIF),整合医疗专业人员的反馈,提升模型的临床相关性和安全性。
提出的方法
- 开发四阶段流程:在精选的医疗语料上进行持续预训练,使用新型双部分指令数据集进行监督微调,从人工智能生成的反馈中进行强化学习(RLAIF),并使用 EleutherAI 基准套件进行全面评估。
- 构建双组件指令微调数据集:通用指令数据集(防止数据泄露)和评估指令数据集(与基准划分一致),以实现模型间的直接比较。
- 利用 GPT-4 和医疗专业人员生成偏好标注以用于 RLAIF,提升模型与临床推理标准的一致性。
- 从基础模型(Mistral 和 LLaMA2)开始,通过在领域特定医疗文本上的持续预训练,随后进行指令微调和 RLHF 训练 Hippo 模型。
- 采用 EleutherAI 语言模型评估工具包,标准化并自动化对六个医疗基准的评估:MedMCQA、PubMedQA、MedQA 以及 USMLE 第 1–3 步。
- 通过发布所有训练配置、超参数、模型检查点和评估脚本,确保完全可复现性。
实验结果
研究问题
- RQ1一个完全开源的医疗大语言模型框架是否能够提升医疗人工智能领域中的可复现性、透明度和社区协作?
- RQ2当采用全面且领域适配的训练流程时,70 亿参数模型在多大程度上能超越更大参数(如 700 亿参数)的模型?
- RQ3在 RLHF 过程中引入医疗专业人员的反馈,对模型性能和临床推理质量有何影响?
- RQ4数据筛选和流程设计(如双指令数据集)对模型泛化能力和基准表现有何影响?
- RQ5标准化的开源评估框架是否能减少差异性并提升医疗大语言模型之间的可比性?
主要发现
- Hippo-7B 在 MedQA 基准测试中达到 59.9% 的 5-shot 准确率,优于所有现有开源模型,包括更大参数的 700 亿参数模型。
- 在 USMLE-step-1 和 USMLE-step-2 基准测试中,Hippo-7B 表现具有竞争力,在复杂临床推理任务中,其模型输出在 85% 的情况下与标准答案匹配。
- Hippo-7B 模型在推理和知识检索方面表现更优,92% 的响应显示出正确的理解、推理过程以及与科学共识的一致性。
- 使用双指令微调数据集(通用和评估)显著减少了数据泄露,实现了更公平、更可靠的基准比较。
- 从人工智能生成的反馈中进行强化学习(RLAIF),并整合医疗专业人员的偏好,提升了模型与临床标准的一致性,减少了有害或错误响应。
- 完整发布训练数据、代码、检查点和评估协议,实现了完全可复现性,并促进了社区驱动的模型改进与审计。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。