[论文解读] IvyGPT: InteractiVe Chinese pathwaY language model in medical domain
IvyGPT 是一个经过监督微调和基于人类反馈的强化学习(RLHF)微调的 330 亿参数中文医疗语言模型,使用高质量的真实医生-患者问答数据进行训练。通过 QLoRA 实现低资源效率训练,其在语义相似度方面达到 93.58 的最先进水平,优于现有模型,在响应丰富度和医疗准确性方面表现更优。
General large language models (LLMs) such as ChatGPT have shown remarkable success. However, such LLMs have not been widely adopted for medical purposes, due to poor accuracy and inability to provide medical advice. We propose IvyGPT, an LLM based on LLaMA that is trained and fine-tuned with high-quality medical question-answer (QA) instances and Reinforcement Learning from Human Feedback (RLHF). After supervised fine-tuning, IvyGPT has good multi-turn conversation capabilities, but it cannot perform like a doctor in other aspects, such as comprehensive diagnosis. Through RLHF, IvyGPT can output richer diagnosis and treatment answers that are closer to human. In the training, we used QLoRA to train 33 billion parameters on a small number of NVIDIA A100 (80GB) GPUs. Experimental results show that IvyGPT has outperformed other medical GPT models.
研究动机与目标
- 开发一个专为中文医疗场景设计的医疗大模型,解决通用模型在临床准确性和文化相关性方面的局限性。
- 通过整合高保真、真实世界的医生-患者对话数据,提升医疗咨询中的响应质量。
- 在硬件资源有限的条件下,通过量化低秩适配(QLoRA)实现对大型医疗模型(330 亿参数)的有效训练。
- 通过基于人类反馈的强化学习(RLHF)提升模型输出,使其更具综合性且与临床实践更契合。
- 在中文医疗领域建立 AI 生成响应与人类医生响应之间语义相似度的基准。
提出的方法
- 该模型基于 LLaMA 架构,使用经过筛选的 307,038 个高质量中文医疗问答对数据集进行监督微调(SFT)。
- 通过人类反馈训练奖励模型以评估响应质量,偏好数据由标注者对模型输出进行评分获得。
- 应用基于人类反馈的强化学习(RLHF)优化响应生成,提升响应的深度与临床相关性。
- 采用 QLoRA 对 330 亿参数模型进行微调,使用 4 位量化,实现在单张 80GB A100 GPU 上的训练。
- 训练流程包括使用 GPT-4 进行数据过滤,以纠正语法错误和常识性错误,确保数据质量。
- 通过词向量嵌入与余弦相似度计算,评估模型输出与人类医生响应之间的语义相似度。
实验结果
研究问题
- RQ1在真实医生-患者对话数据上微调的大语言模型,是否能实现比现有模型更高的语义相似度,以匹配人类医生的响应?
- RQ2与仅使用监督微调相比,RLHF 在多大程度上提升了医疗响应的临床深度与全面性?
- RQ3能否通过使用 4 位量化进行 QLoRA 微调,在硬件资源有限的条件下有效训练 330 亿参数的医疗大模型?
- RQ4训练数据的质量与真实感在多大程度上影响模型生成准确、上下文感知的医疗响应的能力?
- RQ5在医疗大模型中,响应长度与信息丰富度之间存在何种权衡?RLHF 如何影响这一权衡?
主要发现
- IvyGPT 与人类医生响应的语义相似度得分为 93.58,显著优于基线模型,如 ChatMed(84.51)和 MedicalGPT(83.73)。
- 该模型生成的响应平均词数为 271.05,表明其在信息覆盖范围上优于其他中文医疗大模型。
- 强化学习显著提升了响应的长度与深度,证明其在提供全面医疗建议方面能力更强。
- QLoRA 使 330 亿参数模型可在单张 80GB A100 GPU 上高效微调,相比全参数微调或标准 LoRA,显著降低了训练时间和显存占用。
- 该模型在多种医疗场景下表现稳健,对多轮、复杂的医疗查询展现出强大的泛化能力。
- 经 GPT-4 验证增强的 307,038 个真实医生-患者问答对数据集,显著提升了模型的事实准确性与临床相关性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。